Si le jeton (token) est une monnaie, pas l'étalon, alors pourquoi l'utilisons-nous pour mesurer l'intelligence ?

Si le jeton (token) est une monnaie, pas l'étalon, alors pourquoi l'utilisons-nous pour mesurer l'intelligence ?

Fin 2022, générer un million de jetons (tokens) à partir d'un modèle de la classe de GPT-4 coûtait environ 20 $. Aujourd'hui, cela coûte aux alentours de 0,40 $ — soit un effondrement d'un facteur 1 000 en un peu plus de trois ans, l'une des chûtes de coût unitaire les plus rapides de l'histoire de l'informatique. Et pourtant, le PDG de Nvidia monte aujourd'hui sur la scène de la GTC pour affirmer, sans sourciller, que le jeton est la nouvelle unité de valeur économique numérique. Que le chiffre d'affaires équivaut au nombre de jetons par watt multiplié par les gigawatts disponibles.

Ces deux affirmations sont vraies. Et c'est bien là le problème. Si votre étalon de mesure rétrécit de trois ordres de grandeur tous les trois ans, que mesurez-vous exactement ?

Les prétendants, en bref

Soyons équitables envers les candidats. L'intelligence — ou du moins l'utilité machine — a vu passer plusieurs propositions d'unités de mesure, et chacune a eu son heure de gloire.

Les FLOPs ont dominé l'ère de la montée en charge (scaling). Comptez la puissance de calcul, prédisez la capacité. Les lois d'échelle de Kaplan en ont presque fait une science respectable. Mais les FLOPs mesurent l'effort, pas le résultat. J'ai vu exactement la même confusion dans des programmes de gestion du cycle de vie des produits (PLM) : des équipes comptabilisant les heures d'ingénierie comme s'il s'agissait de fonctionnalités. Ce n'est pas le cas. Un modèle qui brûle 10²⁶ FLOPs pour produire des hallucinations a généré de la chaleur, pas de l'intelligence.

Le watt est venu ensuite, appuyé par une physique irréprochable. L'énergie est la contrainte absolue dans chaque projet de centre de données auquel j'ai touché ces quatre dernières années : capacité de refroidissement, files d'attente pour le raccordement au réseau électrique, délais de livraison de 18 mois pour les transformateurs. La formule de Jensen Huang basée sur les « jetons par watt » est séduisante parce qu'elle ramène tout à l'efficacité thermodynamique. Mais les watts mesurent ce que vous dépensez, pas ce que vous obtenez.

Le cache KV — l'empreinte mémoire par contexte simultané — est la métrique des ingénieurs, très utile pour la planification des capacités. Personne en dehors d'une équipe dédiée à l'inférence ne s'en souciera jamais.

Nous en arrivons donc au jeton. Autant par élimination que par mérite propre.

Chaque modèle redessine la règle

C'est ici que les choses se corsent, et que la « tokenomique » devient franchement glissante. L'indice IA de Stanford a documenté une chute d'un facteur 280 du prix d'une inférence à qualité équivalente — équivalente à GPT-3.5, MMLU 64,8 % — entre fin 2022 et fin 2024 seulement. À qualité équivalente. Ce qui signifie que la bonne unité n'a jamais été « le jeton », mais « le jeton à un seuil de qualité fixe ».

Or, ce seuil ne reste pas immobile. GPT-5 et Gemini 2.5 Pro facturent aujourd'hui l'entrée à 1,25 $ par million de jetons — moins cher que GPT-4 à son lancement, tout en étant catégoriquement plus intelligents. DeepSeek V3 propose l'entrée à 0,27 $ par million de jetons. Chaque nouvelle génération de modèles repousse la frontière tout en dévaluant simultanément le prix de tout ce qui se trouve derrière elle. Le jeton de janvier 2024 et celui d'août 2026 sont aussi différents que le franc et l'euro. Même nom, pouvoir d'achat différent.

J'y ai été confronté en établissant un modèle de coût total de possession (TCO) pour un client le trimestre dernier. Nous avions chiffré un pipeline d'extraction de documents aux tarifs des modèles de pointe (frontier), puis nous l'avons réexécuté sur un modèle distillé open source tournant sur leurs propres H100 : 0,18 $ par million de jetons de sortie avec vLLM en taille de lot de 8, soit un écart de 1 à 50 par rapport à l'API louée. Les mêmes jetons. Une réalité économique radicalement différente. Le mot « jeton » portait tout le poids de la formule sans rien expliquer du fond.

Existe-t-il alors un jeton étalon ?

S'il faut absolument en définir un, la seule formulation honnête ressemble à ceci : le coût marginal d'un jeton pour un score fixe sur un benchmark donné, pour une charge de travail de référence, à grande échelle. Les travaux plus rigoureux d'Epoch AI suggèrent que le prix pour une performance donnée sur un benchmark chute de 5 à 10 fois par an — c'est rapide, mais nettement plus lent que le chiffre spectaculaire de 1 000 fois souvent mis en avant, car les benchmarks évoluent eux aussi. C'est précisément dans cet écart entre le chiffre brut et le chiffre ajusté à la qualité que se trouve toute la dynamique économique intéressante.

Le raisonnement de pointe exige encore 3 à 15 $par million de jetons de sortie, contre 0,03 à 0,10$ pour les modèles distillés. Un écart de 1 à 100 au sein d'une même unité nominale. Tout étalon qui ignore cet écart relève du marketing, pas de la métrologie.

Perspectives d'avenir

Observez ce qui se passera lorsque les charges de travail basées sur des agents feront du volume de jetons leur indicateur clé de performance. Si le ratio « jetons par watt et par gigawatt » devient la justification des géants technologiques pour investir dans des campus à 100 milliards de dollars — avec des promesses de chiffre d'affaires potentiel de 150 milliards de dollars par an pour un cluster à l'échelle du gigawatt —, nous aurons bâti tout un cycle d'investissement sur une unité dont la valeur décline de 50 % tous les deux mois. Nous avons déjà vu ce film. Il s'appelait la bande passante, en 1999.

Le jeton pourrait bien devenir la monnaie de l'économie de l'IA. Cependant, les monnaies ont besoin de banques centrales, de taux de change et d'indices d'inflation. Qui est en train de bâtir l'IPC (indice des prix à la consommation) de l'intelligence ? Parce que tant que personne ne le fera, déclarer « nous avons généré 40 billions de jetons ce trimestre » ne nous apprendra rien de plus que « nous avons expédié beaucoup de marchandise ».

On se doute que la réponse réside dans le benchmark qui ne pourra pas être contourné par la prochaine version d'un modèle. Je ne retiendrais pas mon souffle à votre place. Et vous ?

Share:
← Retour au Blog
Appeler