Pourquoi l'IA coûte-t-elle plus cher en Polonais ?
Dire la même chose en Polonais consomme 1.78× les tokens nécessaires en anglais. Comme les fournisseurs facturent au token, cela représente 78% ajoutés à chaque prompt envoyé — non pour de meilleures réponses, mais pour le seul encodage.
La mesure
5ᵉ sur 25 par coût en tokensLe tokenizer plus récent a comblé 30% de l'écart. C'est un vrai progrès, mais pas la parité, et les anciens modèles facturent toujours à l'ancien tarif.
Ce que cela coûte à un vrai produit
$5,853par an, perdus en encodage
Sur la base de 500 milliers d'appels par mois de 500 tokens anglais chacun, à 2,50 $ le million de tokens d'entrée. Entrée uniquement : la longueur de la réponse dépend de la réponse, pas de votre langue.
Mesuré sur cinq registres
Une seule phrase ne prouverait rien : les mêmes cinq textes sont donc mesurés dans chaque langue. La pénalité va de 1.45× à 2.17× selon ce que vous écrivez.
| Type de texte | Tokens | vs anglais |
|---|---|---|
| E-mail professionnel | 65 | 2.17× |
| Réponse au support | 62 | 1.68× |
| Description produit | 63 | 1.85× |
| Instructions | 63 | 1.85× |
| Message informel | 55 | 1.45× |
Pourquoi cela arrive
Le codage par paires d'octets construit son vocabulaire à partir d'un corpus d'entraînement très majoritairement anglais. Les fragments de mots anglais fréquents obtiennent leur propre token ; les chaînes de suffixes et les flexions des autres langues, non — les mots se brisent donc en plus de morceaux que nécessaire.
Questions fréquentes
Pourquoi le Polonais consomme-t-il plus de tokens ?
Les tokenizers apprennent leur vocabulaire sur un corpus très majoritairement anglais : les fragments anglais obtiennent leurs propres tokens tandis que les formes des autres langues se découpent en morceaux plus petits. L'effet est mécanique, ce n'est pas un jugement sur la langue.
Puis-je y faire quelque chose ?
Trois leviers aident. Rédigez les prompts système et les consignes en anglais en gardant le contenu visible par l'utilisateur en Polonais — le modèle comprend la consigne dans les deux cas. Privilégiez les modèles récents, dont les tokenizers traitent nettement mieux le texte non anglais. Et supprimez le remplissage, car la pénalité s'applique à chaque token envoyé, y compris les inutiles.
Est-ce mesuré ou estimé ?
Mesuré. Les vrais tokenizers sont exécutés sur cinq textes parallèles dans chaque langue et les comptages sont exacts. Le seul élément souple est la traduction elle-même : c'est pourquoi le corpus est publié intégralement et l'écart entre les cinq textes est affiché plutôt qu'une moyenne flatteuse.
Langues au coût comparable
Méthode : les vrais tokenizers BPE — cl100k_base pour la génération GPT-4 et o200k_base pour GPT-4o et suivants — sont exécutés sur un corpus parallèle de cinq textes par langue. Les comptages sont exacts, non estimés. Les traductions sont les nôtres et figurent intégralement dans le dépôt, car une formulation plus longue coûterait davantage de tokens et vous devez pouvoir vérifier la nôtre.