Combien un développeur doit-il vraiment consacrer par mois à l'IA ?
J'ai mesuré ma propre consommation pendant deux semaines, appliqué les grilles tarifaires officielles de tout le marché, et sorti un prix au million de tokens pour chaque offre. Voilà les tableaux.
Ce n'est pas un article qui explique quelque chose. C'est une grille de prix, avec juste ce qu'il faut de texte autour pour que les chiffres veuillent dire quelque chose. Tous les tarifs ont été relevés le 11 août 2026 sur les pages officielles des éditeurs, jamais sur un blog comparatif : pendant la préparation, j'ai trouvé le forfait GLM Lite annoncé à 10, 18 et 30 dollars selon la page. Autant aller voir à la source.
Avant les tableaux, il faut que je pose la méthode, parce qu'un prix au million de tokens pour un abonnement, ça ne se lit pas dans une brochure. Ça se calcule. Et le résultat m'a surpris.
Comment je calcule, et pourquoi ça change tout
Un abonnement ne vend plus des tokens. Claude Pro, ChatGPT Plus, GLM Coding Plan : tous vendent des fenêtres de 5 heures et des plafonds hebdomadaires. Pour en tirer un prix au million de tokens, il faut savoir combien de tokens on consomme réellement. Alors je suis allé regarder chez moi.
J'ai passé au peigne fin les journaux de mes sessions Claude Code, dans ~/.claude/projects : 724 fichiers, du 28 juillet au 11 août 2026. Le script fait la somme des tokens déclarés par l'API dans chaque réponse et applique la grille Anthropic. Verdict :
| Période mesurée | 14 jours (28/07 au 11/08/2026) |
| Tokens consommés | 5,85 milliards |
| Ce que ça coûterait à l'API | 4 867 $, soit environ 10 400 $ par mois |
| Coût horaire équivalent | 17,24 $ de l'heure de session |
| Coût moyen au million | 0,83 $ et pas 5 $, ni 25 $ |
Ce dernier chiffre est le cœur du sujet. Claude Opus 5 est facturé 5 dollars le million de tokens en entrée et 25 en sortie. Mon coût réel ressort à 0,83 dollar. Pourquoi ? Parce que la ventilation de ce que consomme un agent de code n'a rien à voir avec ce qu'on imagine :
| Type de token | Part réelle | Tarifé |
|---|---|---|
| Lecture de cache | 95,81 % | 0,1 fois le prix d'entrée |
| Écriture de cache | 3,60 % | 1,25 fois le prix d'entrée |
| Sortie (le code écrit) | 0,55 % | plein tarif de sortie |
| Entrée non cachée | 0,04 % | plein tarif d'entrée |
Un agent de code passe son temps à relire le même dépôt. Ces relectures sont servies par le cache (une copie de ton contexte que le fournisseur garde au chaud et facture dix fois moins cher), et elles écrasent tout le reste. La sortie, le vrai code produit, c'est un demi pour cent du volume. Tous les comparatifs qui posent un mix « 70 % entrée, 30 % sortie » se trompent d'un facteur 5 sur le prix final.
D'où la colonne que j'utilise partout dans les tableaux qui suivent : le coût effectif au million, calculé en appliquant ce mix mesuré à la grille de chaque éditeur. La formule tient en une ligne, tu peux refaire le calcul toi-même :
coût_effectif = prix_entrée × 0,1412 + prix_sortie × 0,005524Deux réserves, et je préfère les dire tout de suite. Un : mon usage est extrême, j'orchestre des sous-agents en parallèle, donc mes volumes sont ceux d'un cas limite, pas d'un développeur moyen. Deux : je n'ai pas testé les quarante offres de cet article. J'utilise Claude Code au quotidien et j'ai bricolé avec Ollama, le reste vient des grilles officielles et des documentations. Je le signale à chaque fois que ça compte.
Le tableau maître : tout, du plus intelligent au moins intelligent
Classement par capacité en code, du haut vers le bas. L'indice est le mien, composé à partir de SWE-bench Verified et SWE-bench Pro relevés sur BenchLM au 10 août 2026, complété par mon ressenti d'usage quand le score public manque. Les estimations sont marquées d'une astérisque.
| Modèle | Indice | SWE-b. V. | Accès | $/Mtok effectif | Entrée mensuelle |
|---|---|---|---|---|---|
| Claude Opus 5 | 100 | 96,0 % | API + abonnement | 0,84 $ | 20 $ |
| Claude Mythos 5 | 99 | 95,5 % | API, accès restreint | 1,69 $ | n.c. |
| Claude Fable 5 | 98 | 95,0 % | API + abonnement | 1,69 $ | 100 $ |
| Claude Opus 4.8 | 90 | 88,6 % | API + abonnement | 0,84 $ | 20 $ |
| GPT-5.6 Sol | 88* | n.c. | API + abonnement | 0,87 $ | 20 $ |
| Claude Sonnet 5 | 86 | 85,2 % | API + abonnement | 0,51 $ 0,34 $ jusqu'au 31/08 | 20 $ |
| GPT-5.6 Terra | 84* | n.c. | API + abonnement | 0,35 $ | 20 $ |
| GPT-5.3 Codex | 82* | n.c. | API + abonnement | 0,32 $ | 20 $ |
| Gemini 3.1 Pro | 80* | n.c. | API + abonnement | 0,35 $ | 100 $ |
| Kimi K3 | 78* | n.c. | API, poids ouverts | 0,51 $ | n.c. |
| GLM-5.2 | 76* | n.c. | API + abonnement | 0,22 $ | 18 $ |
| Grok 4.5 | 75* | n.c. | API + abonnement | 0,32 $ | 30 $ |
| DeepSeek V4 Pro | 74* | n.c. | API, poids ouverts | 0,024 $ | à l'usage |
| Kimi K2.7 Code | 72* | n.c. | API, poids ouverts | 0,16 $ | à l'usage |
| GLM-4.7 | 70* | n.c. | API, poids ouverts | 0,10 $ | à l'usage |
| Qwen3 Coder Next | 66* | n.c. | API, poids ouverts | 0,020 $ | à l'usage |
| Qwen3-Coder 30B (local) | 55* | n.c. | Ollama, sur ta machine | électricité | 0 $ |
| GLM-4.7 Flash (local) | 48* | n.c. | Ollama, sur ta machine | électricité | 0 $ |
Indice sur 100, composé à partir de SWE-bench Verified et SWE-bench Pro (BenchLM, 10 août 2026). Les valeurs marquées d'une astérisque sont mes estimations, faute de score public sur ces deux tests. Le coût effectif applique le mix mesuré plus haut. n.c. veut dire non communiqué, jamais « je n'ai pas cherché ».
Une remarque honnête sur ce classement : les leaderboards ne sont pas d'accord entre eux. BenchLM met Opus 5 en tête à 96 %, CodeSOTA donne Fable 5 à 95 % et un Mythos Preview à 93,9 %. Un écart de deux points entre deux tables qui mesurent censément la même chose, ça dit surtout qu'il ne faut pas jouer les décimales. L'ordre de grandeur est fiable, le classement au dixième près ne l'est pas.
Les abonnements : ce que tu paies vraiment le million
C'est ici que la méthode devient nécessaire. Deux colonnes : ce que ça coûte si tu tapes dans tes limites (colonne « saturé », le chiffre dont les vendeurs se servent), et ce que ça coûte à un rythme réaliste. Mon volume de référence pour la colonne réaliste est de 1 500 millions de tokens par mois, ce qui correspond à peu près à 6 heures d'agent par jour ouvré.
| Offre | $/mois | Plafond documenté | $/Mtok saturé | $/Mtok réaliste |
|---|---|---|---|---|
| Claude Pro | 20 $ 17 $ en annuel | non publié, ~40-80 h/sem | ~0,01 $ | plafond atteint |
| Claude Max 5x | 100 $ | non publié, ~140-280 h/sem | ~0,014 $ | 0,067 $ |
| Claude Max 20x | 200 $ | non publié, ~240-480 h/sem | 0,016 $ mesuré chez moi | 0,13 $ |
| GLM Coding Lite | 18 $ | 43 à 87 Mtok/sem, publié | 0,048 à 0,097 $ | plafond atteint |
| GLM Coding Pro | 72 $ | 263 à 526 Mtok/sem, publié | 0,032 à 0,063 $ | 0,048 $ |
| GLM Coding Max | 160 $ | 613 à 1226 Mtok/sem, publié | 0,030 à 0,060 $ | 0,107 $ |
| ChatGPT Plus | 20 $ | non publié, fenêtres de 5 h | n.c. | plafond atteint |
| ChatGPT Pro | 100 ou 200 $ | non publié | n.c. | 0,067 à 0,13 $ |
| Google AI Ultra 5x | 99,99 $ | multiplicateur, pas de tokens | n.c. | 0,067 $ |
| SuperGrok | 30 $ | limites hebdomadaires | n.c. | 0,020 $ |
| GitHub Copilot Pro | 10 $ | 15 $ de crédits inclus | au prix API | au prix API |
| GitHub Copilot Max | 100 $ | 200 $ de crédits inclus | moitié prix API | moitié prix API |
| Cursor Pro | 20 $ | 500 requêtes rapides/mois | n.c. | n.c. |
| Le Chat Pro | 14,99 $ | non publié | n.c. | n.c. |
Avantages et inconvénients, en vrac. Claude Max 20x est de loin le meilleur rapport tokens sur dollar du marché quand on le sature, mais 200 dollars par mois, ça se justifie devant un comptable. GLM Coding Plan est le seul éditeur qui publie une équivalence officielle en tokens, ce qui est courageux et devrait être la norme : les autres se cachent derrière des « fenêtres de 5 heures » invérifiables. GitHub Copilot a changé de modèle le 1er juin 2026 et facture désormais à l'usage, avec un crédit valant un centime, ce qui en fait plus une API déguisée qu'un forfait. Cursor limite en requêtes et pas en tokens, un compteur qui ne veut rien dire quand une requête peut brasser 200 000 tokens de contexte.
Le chiffre qui m'a fait tiquer, c'est le mien. Sur 14 jours j'ai consommé l'équivalent de 4 867 dollars d'API. Rapporté à un abonnement Max 20x, ça fait un rapport de 52 pour 1. Aucun forfait au monde ne peut être rentable sur ce profil, ce qui veut dire une chose simple : soit Anthropic subventionne massivement, soit les plafonds sont là pour que très peu de gens y arrivent. Probablement les deux.
Les API à la carte : le tableau de vérité
Ici, pas d'estimation ni de plafond flou. Ce sont des grilles publiques. J'ajoute la colonne du coût effectif, celle qui compte réellement pour un agent de code.
| Modèle | Entrée | Cache | Sortie | Contexte | Effectif |
|---|---|---|---|---|---|
| Claude Fable 5 | 10,00 $ | 1,00 $ | 50,00 $ | 1M | 1,69 $ |
| Claude Opus 5 | 5,00 $ | 0,50 $ | 25,00 $ | 1M | 0,84 $ |
| GPT-5.6 Sol | 5,00 $ | 0,50 $ | 30,00 $ | n.c. | 0,87 $ |
| GPT-5.5 Pro | 30,00 $ | aucun | 180,00 $ | n.c. | 5,23 $ |
| Claude Sonnet 5 | 3,00 $ | 0,30 $ | 15,00 $ | 1M | 0,51 $ |
| GPT-5.4 | 2,50 $ | 0,25 $ | 15,00 $ | n.c. | 0,44 $ |
| Gemini 3.1 Pro | 2,00 $ | 0,20 $ | 12,00 $ | 200k+ | 0,35 $ |
| Grok 4.5 | 2,00 $ | 0,30 $ | 6,00 $ | 500k | 0,32 $ |
| GPT-5.3 Codex | 1,75 $ | 0,175 $ | 14,00 $ | n.c. | 0,32 $ |
| GLM-5.2 | 1,40 $ | 0,14 $ | 4,40 $ | n.c. | 0,22 $ |
| Claude Haiku 4.5 | 1,00 $ | 0,10 $ | 5,00 $ | 200K | 0,17 $ |
| Kimi K2.7 Code | 0,95 $ | n.c. | 4,00 $ | n.c. | 0,16 $ |
| GLM-4.7 | 0,60 $ | 0,06 $ | 2,20 $ | n.c. | 0,10 $ |
| DeepSeek V4 Pro | 0,435 $ | 0,0036 $ | 0,87 $ | 1M | 0,024 $ |
| Qwen3.7 Plus | 0,32 $ | n.c. | 1,28 $ | n.c. | 0,052 $ |
| MiniMax M2 | 0,255 $ | n.c. | 1,02 $ | n.c. | 0,042 $ |
| DeepSeek V4 Flash | 0,14 $ | 0,0028 $ | 0,28 $ | 1M | 0,009 $ |
| Qwen3 Coder Next | 0,11 $ | n.c. | 0,80 $ | n.c. | 0,020 $ |
| GLM-4.7 Flash | gratuit | gratuit | gratuit | n.c. | 0 $ |
Prix en dollars par million de tokens. La colonne « Cache » est le tarif de lecture, généralement un dixième de l'entrée. Attention aux tarifs conditionnels : Grok et Gemini doublent au-delà de 200 000 tokens de contexte, Qwen3 Coder Plus a quatre paliers selon la longueur d'entrée. Et le tarif d'introduction de Claude Sonnet 5 (2 $ / 10 $) expire le 31 août 2026, après quoi il remonte à 3 $ / 15 $.
Trois choses sautent aux yeux. D'abord, DeepSeek facture sa lecture de cache à 0,0028 dollar, soit deux pour cent du prix d'entrée, là où tout le monde applique dix pour cent. Sur un agent de code qui relit son contexte en boucle, cet écart de tarification est plus décisif que le prix affiché. DeepSeek V4 Flash ressort à moins d'un centime le million effectif, c'est-à-dire 90 fois moins cher qu'Opus 5. La documentation prévient toutefois qu'une hausse significative est prévue, donc ne construis pas ton business plan dessus.
Ensuite, GPT-5.5 Pro et GPT-5.4 Pro à 30 dollars l'entrée et 180 la sortie n'ont aucun tarif de cache. Sur un agent, c'est éliminatoire : 5,23 dollars le million effectif, soit six fois Opus 5 qui fait mieux en code. Ces modèles sont conçus pour du raisonnement ponctuel, pas pour boucler sur un dépôt.
Enfin, GLM-4.7 Flash est gratuit. Pas « offre de lancement », gratuit dans la grille officielle. Je n'ai pas encore poussé un vrai projet dessus, mais pour du scaffolding et des tâches mécaniques c'est difficile à battre.
Tout l'exercice tient là-dedans : d'un côté ce que ça coûte, de l'autre ce que ça sait faire. Aucune offre ne gagne sur les deux plateaux.
Les agrégateurs : ce qu'ils prennent au passage
Un agrégateur, c'est un intermédiaire qui te donne un seul compte et une seule facture pour cinquante modèles de quinze éditeurs. La question qui fâche, c'est sa marge.
| Plateforme | Marge sur l'inférence | Autres frais | Ce qu'on achète |
|---|---|---|---|
| OpenRouter | 0 %, prix répercutés tels quels | 5,5 % à l'achat de crédits (min. 0,80 $), 5 % en crypto, 5 % en clés perso au-delà de 25 000 $/mois | Un compte pour tout, bascule de modèle à chaud, pas de limite de débit par éditeur |
| Together AI | Grille propre, parfois au-dessus de l'éditeur | aucun frais d'entrée | Modèles à poids ouverts, hébergement dédié possible |
| Fireworks AI | n.c. | n.c. | Paliers standard, priorité et rapide. Grille renvoyée vers la doc, je n'ai pas pu la relever proprement |
| Groq / Cerebras | n.c. | n.c. | Vitesse d'inférence hors norme sur matériel dédié, catalogue restreint |
| Hugging Face | n.c. | n.c. | Le plus large catalogue de modèles ouverts, orienté expérimentation |
La bonne surprise, c'est OpenRouter : zéro marge sur l'inférence, la documentation le dit noir sur blanc. Ils se rémunèrent sur le rechargement de crédits, à 5,5 %. Concrètement, tu paies le prix éditeur plus 5,5 % d'entrée de jeu, et en échange tu changes de modèle en modifiant une chaîne de caractères. Pour tester quinze modèles avant de choisir, c'est imbattable. Pour de la production à gros volume sur un seul modèle, va direct chez l'éditeur.
Les trois lignes à n.c. me gênent et je préfère l'écrire : Fireworks renvoie sa grille vers sa documentation plutôt que de l'afficher, et je n'ai pas voulu recopier des chiffres de seconde main pour boucher le trou. Un tableau avec un trou honnête vaut mieux qu'un tableau plein de suppositions.
Le local : gratuit, mais pas sans contrepartie
Ollama reste gratuit et illimité pour les modèles qui tournent sur ta machine. Ce sont les modèles cloud qui sont facturés, avec un palier gratuit, un Pro à 20 dollars et un Max à 100.
| Modèle local | Indice | VRAM | Débit RTX 4090 | Mon avis |
|---|---|---|---|---|
| Qwen3-Coder 30B | 55* | 19 Go | 40 à 60 tok/s | Le meilleur choix en local. Architecture à experts, 3,3 milliards de paramètres actifs seulement, donc rapide malgré sa taille. 256K de contexte, ce qui est énorme pour du local. Il faut une carte 24 Go |
| GLM-4.7 Flash | 48* | 19 Go | n.c. | 198K de contexte, même gabarit. Alternative crédible, et il existe aussi en API gratuite si tu ne veux pas mobiliser ta carte |
| Qwen3.6 27B | 50* | 17 Go | ~30 tok/s | Modèle dense, donc tous les paramètres travaillent à chaque token. Presque deux fois plus lent que le 30B pour un résultat comparable |
| Kimi, DeepSeek complets | 70+* | 200 Go et plus | très lent | Très bien sur le papier, mais impraticable sur un PC de développeur : il faut une station à plusieurs cartes ou un Mac à 128 Go de mémoire unifiée, et ça reste poussif. À réserver à la curiosité |
Le vrai coût du local, ce n'est pas l'électricité (compte 350 watts sous charge, soit environ 0,10 euro de l'heure au tarif belge d'août 2026, donc quelques euros par mois). C'est la carte graphique : une 4090 d'occasion tourne autour de 1 500 euros, et amortie sur trois ans ça fait déjà 42 euros par mois, avant d'avoir écrit une ligne. Une RTX 3090 d'occasion à 700 euros fait tourner exactement les mêmes modèles 20 % moins vite et divise l'amortissement par deux.
Et l'écart de capacité est réel. Un modèle local à 19 Go se situe autour de 55 sur mon indice, contre 100 pour Opus 5. Ce n'est pas un détail de finition : c'est la différence entre un assistant qui complète ta ligne et un agent qui refactorise ton module tout seul. Le local, à mon sens, sert à trois choses : l'autocomplétion, les tâches mécaniques répétitives, et le travail sur du code qui ne doit sortir d'aucune machine. Pour le reste, l'API pas chère coûte moins que l'amortissement de la carte.
Quatre combos chiffrés, selon ton profil
C'est la partie que je garderais si je devais n'en garder qu'une. Les tableaux du dessus donnent des prix, mais personne n'achète un prix : on achète une pile.
1. Étudiant ou projet perso, 0 $ par mois
| GLM-4.7 Flash en API | 0 $ | le gros du travail |
| Ollama en local | 0 $ | autocomplétion, hors ligne |
| Total | 0 $ | Ce qu'on y perd : les tâches vraiment difficiles bloquent, et il faut savoir reprendre la main |
2. Développeur indépendant, environ 58 $ par mois
| Claude Pro | 20 $ | architecture, revue, finition |
| GLM Coding Lite | 18 $ | le volume, les boucles longues |
| DeepSeek V4 Flash en API | ~20 $ | débordements, traitements par lots |
| Total | 58 $ | Ce qu'on y perd : il faut jongler entre trois outils et savoir quoi envoyer où |
C'est la combinaison dont on parle le plus, et à raison : 20 dollars de Claude Pro achètent le jugement, 18 dollars de GLM achètent le volume. Tu fais poser la base par le modèle bon marché et tu fais peaufiner par le bon. À 20 dollars, DeepSeek V4 Flash te donne, au tarif effectif, plus de deux milliards de tokens de débordement. Oui, deux milliards.
3. Développeur à plein temps sur l'IA, environ 272 $ par mois
| Claude Max 20x | 200 $ | le moteur principal, sans compter |
| GLM Coding Pro | 72 $ | le second moteur, en parallèle |
| Total | 272 $ | Ce qu'on y perd : rien, sauf 272 dollars. À ce niveau on paie pour ne plus penser au compteur |
C'est à peu près ma pile, et le calcul est vite fait : ce que je consomme coûterait environ 10 400 dollars par mois à l'API. Même en divisant par cinq pour un usage moins agressif, l'abonnement reste rentable d'un facteur dix. Sur ce profil, l'API à la carte n'a aucun sens.
4. Petite équipe de cinq développeurs, environ 190 $ par mois
| Copilot Business, 5 sièges | 95 $ | autocomplétion et intégration dans les dépôts |
| GLM Coding Pro partagé | 72 $ | l'agent lourd sur les gros chantiers |
| Crédits API de secours | ~23 $ | via OpenRouter, pour tester sans multiplier les comptes |
| Total | 190 $ | Ce qu'on y perd : pas d'accès aux modèles de tête pour tout le monde en permanence |
Ce que je retiens
Le prix affiché d'un modèle ne dit presque rien de ce que tu vas payer. Ce qui compte, c'est le tarif de lecture de cache, parce que c'est 96 % de ce qu'un agent de code consomme. Deux modèles au même prix affiché peuvent finir à un rapport de 1 à 5 selon leur politique de cache, et un modèle sans cache du tout est disqualifié d'office quel que soit son score.
Ensuite, l'écart de prix entre le haut et le bas du tableau est de l'ordre de 90 fois, alors que l'écart de capacité en code est de l'ordre de deux. Ça ne veut pas dire que le haut de gamme ne vaut rien : sur une tâche que le petit modèle rate, le prix au token n'a aucune importance, seul compte le fait que ça passe ou non. Mais ça veut dire qu'envoyer chaque tâche au modèle le plus cher est un gaspillage. La bonne pile en met deux ou trois côte à côte.
Enfin, si tu ne devais retenir qu'un chiffre : entre 40 et 60 dollars par mois, un développeur indépendant a aujourd'hui accès à une puissance qui coûtait plusieurs milliers de dollars il y a un an. Le débat n'est plus « est-ce que ça vaut le coup », il est « quelle combinaison ».
Tous les tarifs relevés le 11 août 2026 sur les pages officielles des éditeurs. Les prix sont en dollars américains, hors TVA (comptez 21 % en Belgique sur les abonnements grand public ; au taux du jour, 1 dollar vaut environ 0,92 euro). Mesures de consommation réalisées sur mes propres journaux de session Claude Code, du 28 juillet au 11 août 2026. Le tarif d'introduction de Claude Sonnet 5 expire le 31 août 2026 : je mettrai le tableau à jour début septembre.

Rejoignez la conversation
Vous devez avoir un compte pour commenter cet article. La création est gratuite et prend moins d'une minute.
Aucun commentaire pour le moment.