Aller au contenu

1,5 % de requêtes de raisonnement suffisent à doubler la consommation d'un service IA

Quand 1,5 % des requêtes d'un service IA basculent en mode raisonnement, sa consommation électrique double. Le rapport de force explique tout : un prompt texte coûte 0,3 Wh, une requête de raisonnement environ 20 Wh, soit 67 fois plus. Une petite minorité de requêtes lourdes suffit à peser autant que tout le trafic restant. La seule publication évaluée par les pairs qui aborde ce seuil le place à 10 %. L'écart entre les deux chiffres n'est pas un désaccord d'arithmétique. Il vient du prix qu'on donne à une requête de raisonnement.

Chiffres au 30 juin 2026. Aucune valeur du site n'a été modifiée pour cette page : les deux termes du calcul y étaient déjà publiés.

Le calcul, posé

Deux coûts par requête, une division. Rien d'autre n'entre dans le seuil.

Prompt texte0,3 Wh

Valeur de référence du site pour un prompt texte moyen. Les chiffres publiés par Google, Epoch AI et OpenAI tiennent entre 0,24 et 0,4 Wh.

Requête de raisonnement20 Wh

Le modèle génère ses étapes intermédiaires avant de répondre. Aucun fournisseur ne publie de chiffre officiel pour ses modes de raisonnement. Les bancs d'essai indépendants placent ces requêtes entre 15 et 30 Wh ; le site retient 20 Wh.

Part qui double la consommation1,5 %

Un service dont une part p des requêtes passe en raisonnement consomme en moyenne (1 - p) × 0,3 + p × 20 Wh par requête. Doubler, c'est atteindre 0,6 Wh. On résout : p × 19,7 = 0,3, donc p = 0,3 ÷ 19,7 = 1,5 %. Soit une requête sur 66.

Pourquoi une requête de raisonnement coûte-t-elle autant ?

Elle écrit avant de répondre. Le modèle produit une chaîne d'étapes intermédiaires, souvent plus longue que la réponse finale. Chaque jeton généré déclenche un passage complet dans le réseau. Le coût suit donc le nombre de jetons produits, pas la difficulté apparente de la question.

Un second effet s'ajoute, moins visible. Une requête longue occupe la mémoire de la carte graphique pendant toute sa durée. Le serveur traite alors moins de requêtes en parallèle, et le coût fixe de la machine se répartit sur moins de travail utile. L'article de Joule cite les deux mécanismes ensemble : plus de jetons produits, moins de parallélisme.

À prompt identique, l'écart mesuré est brutal. Jegham et ses coauteurs font passer le même prompt long sur trente modèles commerciaux. o3 et DeepSeek-R1 dépassent 33 Wh, plus de 70 fois ce que consomme GPT-4.1 nano sur ce même prompt. La question ne change pas, seul le modèle change.

Pourquoi le seuil publié va-t-il de 1,5 % à 10 % ?

Parce que les deux camps ne mesurent pas le même objet. Le seuil ne tient qu'à un paramètre, le rapport entre une requête de raisonnement et un prompt texte, et ce rapport n'est pas connu à mieux qu'un facteur six.

Le rapport entre une requête de raisonnement et un prompt texte, et la part de doublement qui en découle.
Origine du rapportRapport retenuPart qui double
Joule, avril 2026 (déduit)11 ×10 %
Données du site67 ×1,5 %
How Hungry is AI?, mai 202570 ×1,4 %

Le seuil de 10 % de Joule vient d'une simulation de Monte-Carlo sur des modèles à poids ouverts, avec des hypothèses de production : traitement par lots, taux d'occupation élevé, matériel récent. Le rapport de 70 fois vient d'une reconstruction à partir des temps de réponse d'API commerciales, sur les modèles de frontière tels qu'ils tournent. Chaque méthode a sa faiblesse. La simulation suppose une infrastructure idéale que personne ne garantit. La reconstruction devine un matériel qu'elle ne voit jamais.

L'arithmétique, elle, ne bouge pas. Une part de doublement et un rapport de consommation disent la même chose : le rapport vaut 1 + 1 ÷ p. Quand Joule écrit que 10 % des requêtes quotidiennes peuvent plus que doubler la consommation totale, cela implique un rapport de 11 fois exactement, soit le plancher de son propre « plus d'un ordre de grandeur ». C'est la lecture la plus prudente disponible, et nous la gardons comme borne haute du seuil. Les mêmes auteurs estiment que les estimations publiques les plus reprises surévaluent d'un facteur 4 à 20. Ils travaillent chez un fournisseur qui a intérêt au chiffre bas, et cela mérite d'être dit.

Qu'est-ce que cela pèse à l'échelle de toute l'IA générative ?

Le site retient 1 100 milliards de prompts texte par an pour l'ensemble de l'IA générative textuelle. À 0,3 Wh la requête, cela fait 330 GWh par an. Il suffit que 16,8 milliards de ces requêtes passent en raisonnement, soit 1,5 % du total, pour que ce chiffre double.

Le surcoût vaut alors 330 GWh de plus, l'électricité annuelle d'environ 77 000 foyers français. Ce basculement ne demande aucun centre de données supplémentaire, aucun nouvel utilisateur, aucune requête de plus. Il demande seulement qu'une requête sur 66 change de mode.

C'est pour cette raison que le seuil mérite un chiffre. Les modes agents et raisonnement sont devenus le réglage par défaut de plusieurs assistants en 2026. La bascule ne se lit pas dans le nombre de requêtes, seul indicateur que les fournisseurs communiquent. Elle se lit dans leur composition, que personne ne publie.

Ce que ce seuil ne dit pas

  • Électricité en usage seule. Ni entraînement du modèle, ni fabrication des serveurs, ni réseau. Le périmètre est celui du reste du site.
  • Le rapport de 67 fois est traité ici comme une constante. En pratique il bouge avec le modèle, avec la longueur du raisonnement demandé et avec le matériel qui l'exécute.
  • Le seuil suppose que le reste du trafic reste du texte. Une part croissante d'images ou de vidéo relève la moyenne de départ et fait baisser le seuil.
  • Aucun fournisseur ne publie la composition réelle de son trafic. Ce calcul dit à partir de quand la consommation bascule, pas où en sont les services aujourd'hui.

Sources

Citer ce chiffre

À 20 Wh la requête de raisonnement contre 0,3 Wh le prompt texte, 1,5 % de requêtes de raisonnement suffisent à doubler la consommation électrique d'un service IA. Le seuil remonte à 10 % si l'on retient le rapport le plus prudent publié à ce jour (11 fois, Joule, avril 2026). Calcul et sources sur cette page : howmanyprompts.com.

Reste la question que ce calcul ne tranche pas : quels usages méritent un mode raisonnement, et lesquels s'en passent très bien. Le studio ghis.fr travaille cette question avec des TPE et des PME. Ici, on mesure, et on s'arrête là.

À lire ensuite