Toutes les langues
العربية

Pourquoi l'IA coûte-t-elle plus cher en Arabe ?

Dire la même chose en Arabe consomme 1.45× les tokens nécessaires en anglais. Comme les fournisseurs facturent au token, cela représente 45% ajoutés à chaque prompt envoyé — non pour de meilleures réponses, mais pour le seul encodage.

La mesure

16ᵉ sur 25 par coût en tokens
1.45×de tokens de plus que l'anglais pour le même sens — 45% ajoutés à chaque prompt envoyé.
GPT-4 / GPT-3.5
3.18×
1.36 caractères/token
GPT-4o / GPT-5
1.45×
3.02 caractères/token

Le tokenizer plus récent a comblé 79% de l'écart. C'est un vrai progrès, mais pas la parité, et les anciens modèles facturent toujours à l'ancien tarif.

Ce que cela coûte à un vrai produit

$3,382par an, perdus en encodage

Sur la base de 500 milliers d'appels par mois de 500 tokens anglais chacun, à 2,50 $ le million de tokens d'entrée. Entrée uniquement : la longueur de la réponse dépend de la réponse, pas de votre langue.

Mesuré sur cinq registres

Une seule phrase ne prouverait rien : les mêmes cinq textes sont donc mesurés dans chaque langue. La pénalité va de 1.30× à 1.82× selon ce que vous écrivez.

Type de texteTokensvs anglais
E-mail professionnel391.30×
Réponse au support501.35×
Description produit621.82×
Instructions471.38×
Message informel531.39×

Pourquoi cela arrive

L'écriture arabe coûte deux octets par caractère en UTF-8, et sa morphologie par racines et schèmes produit des formes que le tokenizer a rarement vues comme une unité. Les mots sont donc découpés en de nombreux petits morceaux.

Questions fréquentes

Pourquoi le Arabe consomme-t-il plus de tokens ?

Les tokenizers apprennent leur vocabulaire sur un corpus très majoritairement anglais : les fragments anglais obtiennent leurs propres tokens tandis que les formes des autres langues se découpent en morceaux plus petits. L'effet est mécanique, ce n'est pas un jugement sur la langue.

Puis-je y faire quelque chose ?

Trois leviers aident. Rédigez les prompts système et les consignes en anglais en gardant le contenu visible par l'utilisateur en Arabe — le modèle comprend la consigne dans les deux cas. Privilégiez les modèles récents, dont les tokenizers traitent nettement mieux le texte non anglais. Et supprimez le remplissage, car la pénalité s'applique à chaque token envoyé, y compris les inutiles.

Est-ce mesuré ou estimé ?

Mesuré. Les vrais tokenizers sont exécutés sur cinq textes parallèles dans chaque langue et les comptages sont exacts. Le seul élément souple est la traduction elle-même : c'est pourquoi le corpus est publié intégralement et l'écart entre les cinq textes est affiché plutôt qu'une moyenne flatteuse.

Langues au coût comparable

Méthode : les vrais tokenizers BPE — cl100k_base pour la génération GPT-4 et o200k_base pour GPT-4o et suivants — sont exécutés sur un corpus parallèle de cinq textes par langue. Les comptages sont exacts, non estimés. Les traductions sont les nôtres et figurent intégralement dans le dépôt, car une formulation plus longue coûterait davantage de tokens et vous devez pouvoir vérifier la nôtre.