En 2017, « Attention Is All You Need » était un clin d'œil astucieux aux Beatles dans un article de NeurIPS sur la traduction automatique. En 2026, l'attention est ce que vous payez.
L'article original sur le Transformer remplaçait les réseaux récurrents par de l'attention pure, obtenant les meilleurs scores BLEU de l'état de l'art tout en réduisant le temps d'entraînement sur 8 GPU P100.
En supprimant la récurrence et en s'appuyant sur l'attention par produit scalaire échelonné (scaled dot-product attention), les auteurs ont rendu les modèles séquentiels à la fois plus parallélisables et plus gourmands en calcul d'une manière très spécifique : chaque nouveau token veut « regarder » tous les autres tokens.
Avance rapide jusqu'à l'ère des LLM : cette opération d'attention se trouve désormais derrière des API, et chaque coup d'œil a un prix. La recherche en tokenomics définit les tokens comme les primitives économiques centrales de l'IA agentique, liant directement les calculs à forte intensité d'attention aux coûts.
J'ai constaté ce changement lors des revues d'architecture : nous sommes passés de « le modèle peut-il traiter cela ? » à « pouvons-nous nous permettre de le laisser prêter attention à tout cela, tout le temps ? ».
Le Transformer était une victoire architecturale. La tokenomics en a fait un modèle de facturation.
La principale innovation du Transformer résidait dans le calcul de l'attention sur l'ensemble des positions en parallèle, en utilisant l'auto-attention multi-têtes (multi-head self-attention) au lieu d'une récurrence étape par étape.
La formule de l'article est simple : l'attention est un softmax sur𝑄𝐾𝑇/𝑑𝑘QKT/dk multiplié par 𝑉V, mais en pratique, cela signifie que chaque token interagit avec tous les autres, par tête et par couche.
Cette interaction quadratique est une merveille mathématique et un cauchemar économique lorsque vos fenêtres de contexte atteignent des centaines de milliers de tokens. Les récentes études sur la tokenomics traitent les tokens comme des facteurs de production, des moyens d'échange et des unités de compte : pas seulement des points de données, mais des facteurs de coûts explicites.
Dans les systèmes d'IA en production, cela se traduit par une question très concrète : quelle quantité du contexte de l'utilisateur votre modèle peut-il se permettre de prendre en compte avant que la facture de tokens ne détruise votre marge ?
J'ai vu des équipes l'apprendre à leurs dépens. Un pipeline d'agent « intelligent » qui injecte logs, documentation et métriques dans un seul prompt géant semble formidable sur le papier, jusqu'à ce que quelqu'un vérifie les dépenses mensuelles en tokens et réalise que la majeure partie de l'attention a été consommée par des lignes insignifiantes dans des fichiers de logs.
Attention, contexte et le coût caché du « rajoutons juste des tokens »
Les guides destinés aux entreprises avertissent désormais explicitement que l'IA est un système économique aux coûts imprévisibles basés sur les tokens, qui doit être géré avec la même rigueur que les dépenses cloud.
Les recommandations FinOps de Microsoft sur la tokenomics sont sans détour : les tokens sont un coût, et l'architecture doit partir du budget de tokens plutôt que du plus grand modèle ou du contexte le plus long que l'on peut techniquement activer.
Côté offre, une étude récente sur la tokenomics des agents LLM formalise l'attention comme un facteur de production sous contrainte budgétaire : vous pouvez substituer davantage de tokens et de têtes d'attention pour obtenir une meilleure qualité, mais seulement jusqu'au point où le coût marginal dépasse la valeur marginale.
Côté demande, les analystes du secteur parlent des tokens comme d'une nouvelle unité de compte pour l'IA : non plus le « nombre d'appels d'API », mais les « tokens consommés pour l'attention, le raisonnement et la génération à travers un écosystème d'agents ».
J'ai vu des équipes repenser complètement leurs couches de recherche documentaire (retrieval), car la méthode naïve consistant à « récupérer 200 documents et laisser le modèle décider » s'est avérée être l'une des phrases les plus coûteuses de leur architecture. L'attention est puissante, mais une attention non filtrée coûte une fortune.
Attention Is All You Need — à condition d'être sélectif
L'article original démontrait que l'attention pouvait remplacer entièrement la récurrence pour la traduction et l'analyse syntaxique, offrant de meilleurs résultats avec un coût d'entraînement moindre.
Ce dont il n'avait pas à se soucier lors de NeurIPS 2017, c'était d'un monde où chaque passe avant (forward pass) est facturée en centimes par millier de tokens et multipliée par des millions d'utilisateurs. C'est pourtant le monde dans lequel nous vivons aujourd'hui.
Les cadres modernes de la tokenomics promeuvent une idée simple mais peu évidente : l'attention doit être traitée comme une ressource rare, allouée stratégiquement aux niveaux micro, méso et macro des systèmes d'IA.
- Micro (agent individuel) : restreindre l'attention lourde aux tâches véritablement ambiguës ou à forte valeur ajoutée, et utiliser des mécanismes plus économiques (recherche légère, motifs mis en cache) ailleurs.
- Méso (systèmes multi-agents) : éviter le doublon d'attention entre les agents ; concevoir une mémoire partagée afin que plusieurs agents ne paient pas séparément pour re-traiter le même contexte.
- Macro (écosystèmes) : traiter la congestion — trop d'agents prêtant trop d'attention à trop de contexte — comme une externalité économique qui doit être tarifée et régulée.
J'ai vu des prototypes multi-agents bloqués parce que personne n'avait chiffré le fait que chaque agent exécutait une passe d'attention complète sur la même spécification de 50 pages. L'architecture était correcte ; l'économie ne l'était pas.
À quoi pourrait ressembler une ingénierie « consciente de l'attention »
Les études de cabinets de conseil comme Deloitte invitent déjà les DSI à gérer l'IA comme un système économique piloté par les tokens, et non comme une capacité théorique.
L'implication pour l'ingénierie est évidente : les mécanismes d'attention, les fenêtres de contexte et les politiques de cache KV deviennent des sujets FinOps autant que des sujets de conception de modèles.
Si l'on extrapole les tendances actuelles, un avenir proche plausible ressemble à ceci :
- Les IDE affichent des « calques de coût d'attention » sur les prompts et les requêtes RAG : une estimation des tokens que le modèle dépensera à analyser votre contexte avant de générer.
- Les orchestrateurs imposent des budgets de tokens différentiables, comme le suggère la recherche en tokenomics, où les gradients ne s'écoulent pas seulement à travers les poids mais à travers les décisions d'allocation budgétaire.
- Les équipes définissent des « politiques d'attention » aux côtés des politiques d'accès : quelles données peuvent être traitées de manière exhaustive, lesquelles doivent passer par un filtrage strict, et lesquelles ne sont touchées que par des modèles à bas coût sauf dérogation explicite.
J me mets à observer ce type d'approche dans des outils émergents qui affichent la ventilation des tokens par étape d'agent. Des développeurs qui ignoraient autrefois les tableaux de bord de coûts demandent désormais : « Pourquoi la passe d'attention sur cette étape est-elle plus chère que tout le reste de la tâche réuni ? »
Le prochain slogan pourrait être « Selective Attention Is All You Need »
Le titre de l'article de 2017 était optimiste : l'attention seule suffisait à surpasser les anciennes architectures.
En 2026, l'affirmation nécessite une nuance économique : l'attention est tout ce dont vous avez besoin, à condition de pouvoir la limiter aux parties du problème qui justifient la dépense en tokens. C'est moins accrocheur, mais c'est une description plus honnête de ce à quoi ressemblent les systèmes basés sur les transformers à grande échelle.
La communauté de la tokenomics pointe déjà vers des « marchés dynamiques » de tokens et des budgets différentiables comme axes d'avenir.
Si cet avenir se concrétise, nous aurons des agents négociant l'attention qu'ils sont autorisés à accorder à une tâche, dépensant des tokens comme une monnaie sur un marché interne. À ce stade, l'expression « Attention Is All You Need » cessera d'être le titre astucieux d'un article de recherche pour devenir une véritable règle économique : le système dont l'attention est bien tarifée, allouée et contrainte l'emportera — non seulement sur les scores BLEU, mais aussi sur le bilan comptable.
Share: