
Utiliser une intelligence artificielle en français pourrait coûter sensiblement plus cher qu’en anglais, même lorsqu’on lui soumet exactement le même contenu. Une étude de Baracoda AI Labs estime que le français nécessite entre 31 % et 58 % de tokens supplémentaires selon le système utilisé. Cette différence touche notamment les technologies de découpage employées par OpenAI, Meta, Google, Mistral, Alibaba, DeepSeek et Anthropic.
Cette différence vient du fonctionnement même des grands modèles de langage. Les services d’IA ne traitent pas directement les mots, mais les découpent en unités appelées « tokens », qui servent aussi de base à leur facturation et à la taille de leur mémoire contextuelle. Or, ces systèmes ont historiquement été conçus à partir de corpus où l’anglais occupe une place dominante. Certains mots français sont donc découpés en plusieurs tokens alors que leur équivalent anglais peut n’en nécessiter qu’un.
Les chercheurs ont comparé les mêmes contenus dans 124 variétés linguistiques à partir d’un corpus de 1 997 phrases d’actualité traduites professionnellement. Le français exige 1,31 fois plus de tokens que l’anglais avec le tokenizer de Mistral, 1,36 fois avec celui d’OpenAI, 1,41 fois avec Google, 1,45 fois avec Claude, et jusqu’à 1,58 fois avec Meta Llama 3. Le chinois simplifié fait mieux que le français dans six des sept systèmes étudiés.
L’écart devient encore plus important pour plusieurs langues régionales ou francophones. Sur la Déclaration universelle des droits de l’homme, le breton, le corse, le wolof et le bambara nécessitent environ deux fois plus de tokens que l’anglais. Le picard, le wallon et le tahitien se situent plutôt entre 2,5 et 3,5 fois le volume anglais. Pour l’utilisateur, cela signifie non seulement davantage de tokens facturés, mais aussi une fenêtre de contexte qui se remplit plus rapidement.
Dans le cas d’une requête courte, l’impact financier est relativement simple à calculer. À tarif identique par jeton, une opération coûtant 100 dollars en anglais pourrait représenter entre 131 et 158 dollars en français. La situation devient toutefois plus complexe avec les agents d’IA qui renvoient l’ensemble de l’historique de la conversation à chaque nouvel échange. Dans une simulation réalisée avec les tarifs à paliers de Gemini 3.1 Pro, le texte français franchissait le seuil de 200 000 jetons au 29e échange, contre le 41e pour l’anglais. Pendant une partie de la conversation, chaque échange en français coûtait alors 2,8 fois plus cher.
C’est dans ce contexte que Baracoda AI Labs estime que cette différence n’est pas inévitable. L’entreprise a d’ailleurs développé Baracoda FR, un prototype de tokenizer davantage optimisé pour le français. Lors d’un test final réalisé sur des corpus qui n’avaient pas été utilisés pendant sa conception, ce système a nécessité 11,5 % moins de jetons en français que le tokenizer Tekken de Mistral, et 3,7 % moins en anglais. Le prototype présente toutefois des compromis importants : il consomme entre 30 % et 38 % de jetons supplémentaires en espagnol et en allemand et plus du double en chinois dans certains tests.
Les auteurs invitent donc à interpréter ces résultats avec prudence. L’étude mesure le nombre de tokens, et non les factures réellement payées, la qualité des réponses ou le taux de réussite des tâches. Modifier le tokenizer d’un modèle existant implique également de réentraîner au moins une partie du modèle, avec des coûts et des risques qui restent à mesurer. Les travaux montrent néanmoins qu’une partie de ce désavantage linguistique découle directement de choix techniques et qu’un meilleur équilibre dans les données utilisées pour concevoir les tokenizers peut réduire sensiblement l’écart entre le français et l’anglais.
Sources : arxiv.org, Github/Baracoda-ai-labs
+++++++
Du lundi au vendredi, Bruno Guglielminetti vous propose un regard sur
l’essentiel de l’actualité numérique avec 120 secondes de Tech.
Ou encore…
Écoutez la plus récente édition de Mon Carnet,
le magazine hebdomadaire de l’actualité numérique.
En savoir plus sur Mon Carnet
Subscribe to get the latest posts sent to your email.

