Combien consomme une image générée avec Stable Diffusion ?
Une image générée avec Stable Diffusion XL consomme 11,49 Wh. La version 1.5, publiée un an plus tôt, en consomme 1,38, huit fois moins, pour le même type d'image et le même banc de mesure, daté du 28 novembre 2023. C'est la seule étude qui compare des générateurs d'image modèle par modèle : aucun service commercial, ni Midjourney, ni DALL·E, ni Imagen, ne publie ses propres chiffres.
Chiffres publiés le 28 novembre 2023, mesuré en laboratoire sur une carte graphique dédiée (pas un service commercial) · Sources : Luccioni, Jernite & Strubell : « Power Hungry Processing: Watts Driving the Cost of AI Deployment? » (arXiv 2311.16863, nov. 2023 ; ACM FAccT, juin 2024) : 1,38 kWh pour 1 000 images avec Stable Diffusion v1.5, 11,49 kWh avec Stable Diffusion XL, le modèle le moins efficace du panel · ADEME : consommation des appareils ménagers
D'où viennent les 11,49 Wh de Stable Diffusion XL ?
D'une étude indépendante, pas d'un chiffre de Stability AI. Luccioni, Jernite et Strubell ont fait tourner mille générations d'image sur huit modèles à poids ouverts, chacun sur la même carte graphique unique, et publié la facture énergétique de chacun (« Power Hungry Processing », soumis le 28 novembre 2023, publié à la conférence ACM FAccT en juin 2024). Stable Diffusion XL (stabilityai/stable-diffusion-xl-base-1.0) est le modèle le moins efficace des huit, à 11,49 kWh pour mille images, soit 11,49 Wh l'image. Rapportée aux 25 Wh qu'un ordinateur portable consomme en une heure (ADEME), une seule image XL équivaut à environ 28 minutes d'écran.
Et la version 1.5, elle consomme combien ?
1,38 kWh pour mille images, soit 1,38 Wh l'image : huit fois moins que XL, mesuré sur le même banc. Runwayml/stable-diffusion-v1-5 reste l'un des modèles les plus déployés du marché, malgré son âge. Avec le même calcul d'écran, la version 1.5 ne pèse qu'environ 3 minutes de portable. Entre les deux, les six autres modèles du panel s'étagent de 0,76 Wh (segmind/tiny-sd, un modèle allégé) à 3,39 Wh (dreamlike-art/dreamlike-photoreal-2.0) : le poids du modèle pèse plus que le simple fait de générer une image plutôt qu'un texte.
Pourquoi Midjourney et DALL·E n'ont pas leur page ?
Parce qu'aucun des deux n'a publié de chiffre. Cette mesure existe seulement pour des modèles à poids ouverts, qu'on peut télécharger et chronométrer sur son propre matériel. Midjourney et DALL·E sont des services fermés : personne en dehors d'OpenAI ou de Midjourney Inc. ne peut mesurer ce qu'ils consomment réellement. C'est la même limite que Google est seul à avoir levée pour le texte, avec Gemini : un fournisseur qui publie ses propres chiffres, mesurés sur son parc, reste l'exception, pas la règle.
Ce chiffre couvre-t-il un vrai service commercial ?
Non, et probablement pas dans le sens qu'on croit. La mesure tourne sur une seule carte graphique dédiée, sans les serveurs au repos, les pertes du centre de données ni la file d'attente d'un vrai service en production. Ces postes s'ajoutent toujours, jamais l'inverse : la version en production d'un modèle commercial consomme vraisemblablement plus que sa mesure en laboratoire, pas moins. C'est pour cette raison que ce site retient une valeur plus haute comme hypothèse pour une image IA générique quand aucun modèle n'est précisé : un chiffre placé en haut de l'encadrement mesuré ici, pas au milieu.
Un prompt Stable Diffusion en gestes du quotidien
Les chiffres publiés pour Stable Diffusion, convertis avec les gestes de référence du site (chaque valeur de geste est sourcée, voir la page Sources) :
- 1 heure d'ampoule LED = 0,87 prompts Stable Diffusion
- 1 heure de télévision = 6,1 prompts Stable Diffusion
Le chiffre d'un modèle ne dit pas lequel choisir pour un usage donné, ni si générer l'image sert à quelque chose. C'est un autre métier : le studio GHIS aide les entreprises à cadrer leurs usages de l'IA.