Warum kostet KI auf Polnisch mehr?
Dasselbe auf Polnisch zu sagen, verbraucht das 1.78-Fache der Tokens, die es auf Englisch braucht. Da Anbieter je Token abrechnen, sind das 78% Aufschlag auf jeden Prompt — nicht für bessere Antworten, sondern allein für die Kodierung.
Die Messung
Platz 5 von 25 nach Token-KostenDer neuere Tokenizer hat 30% der Lücke geschlossen. Das ist echter Fortschritt, aber keine Gleichstellung — ältere Modelle rechnen weiter zum alten Tarif ab.
Was das ein echtes Produkt kostet
$5,853pro Jahr, allein für die Kodierung
Bei 500 Tausend Aufrufen im Monat mit je 500 englischen Tokens, zu 2,50 $ je Million Eingabe-Tokens. Nur die Eingabeseite — die Antwortlänge ist eine Eigenschaft der Antwort, nicht Ihrer Sprache.
Über fünf Textsorten gemessen
Ein einzelner Satz würde nichts beweisen, deshalb werden in jeder Sprache dieselben fünf Texte gemessen. Der Aufschlag reicht je nach Textsorte von 1.45× bis 2.17×.
| Textsorte | Tokens | ggü. Englisch |
|---|---|---|
| Geschäfts-E-Mail | 65 | 2.17× |
| Support-Antwort | 62 | 1.68× |
| Produktbeschreibung | 63 | 1.85× |
| Anleitung | 63 | 1.85× |
| Alltagsnachricht | 55 | 1.45× |
Warum das passiert
Byte-Pair-Encoding bildet sein Vokabular aus Trainingstext, der ganz überwiegend englisch ist. Häufige englische Wortbausteine erhalten ein eigenes Token; die Suffixketten und Flexionen anderer Sprachen nicht — Wörter zerfallen daher in mehr Teile als nötig.
Häufige Fragen
Warum verbraucht Polnisch mehr Tokens?
Tokenizer lernen ihr Vokabular aus ganz überwiegend englischem Trainingstext. Englische Wortbausteine bekommen eigene Tokens, während Wortformen anderer Sprachen in kleinere Stücke zerfallen. Der Effekt ist mechanisch und kein Urteil über die Sprache.
Kann ich etwas dagegen tun?
Drei Dinge helfen. Schreiben Sie System-Prompts und Anweisungen auf Englisch und belassen Sie die für Nutzer sichtbaren Inhalte auf Polnisch — das Modell versteht die Anweisung so wie so. Bevorzugen Sie neuere Modelle, deren Tokenizer nicht-englischen Text deutlich besser verarbeiten. Und streichen Sie Floskeln, denn der Aufschlag gilt für jedes gesendete Token, auch für die überflüssigen.
Ist das gemessen oder geschätzt?
Gemessen. Die echten Tokenizer laufen über fünf parallele Texte je Sprache, die Zahlen sind exakt. Der einzige weiche Faktor ist die Übersetzung selbst — deshalb ist das Korpus vollständig veröffentlicht und statt eines schmeichelhaften Mittelwerts wird die Streuung über alle fünf Texte gezeigt.
Sprachen mit ähnlichen Kosten
Methode: Die echten BPE-Tokenizer — cl100k_base für die GPT-4-Generation und o200k_base für GPT-4o und später — laufen über ein paralleles Korpus aus fünf Texten je Sprache. Die Token-Zahlen sind exakt, nicht geschätzt. Die Übersetzungen stammen von uns und stehen vollständig im Repository, denn eine wortreichere Fassung kostet mehr Tokens, und Sie sollen unsere prüfen können.