Prix au million de tokens : le comparatif complet des IA pour coder (abonnements, API, agrégateurs, local)

Combien un développeur doit-il vraiment consacrer par mois à l'IA ?

J'ai mesuré ma propre consommation pendant deux semaines, appliqué les grilles tarifaires officielles de tout le marché, et sorti un prix au million de tokens pour chaque offre. Voilà les tableaux.

Ce n'est pas un article qui explique quelque chose. C'est une grille de prix, avec juste ce qu'il faut de texte autour pour que les chiffres veuillent dire quelque chose. Tous les tarifs ont été relevés le 11 août 2026 sur les pages officielles des éditeurs, jamais sur un blog comparatif : pendant la préparation, j'ai trouvé le forfait GLM Lite annoncé à 10, 18 et 30 dollars selon la page. Autant aller voir à la source.

Avant les tableaux, il faut que je pose la méthode, parce qu'un prix au million de tokens pour un abonnement, ça ne se lit pas dans une brochure. Ça se calcule. Et le résultat m'a surpris.

Comment je calcule, et pourquoi ça change tout

Un abonnement ne vend plus des tokens. Claude Pro, ChatGPT Plus, GLM Coding Plan : tous vendent des fenêtres de 5 heures et des plafonds hebdomadaires. Pour en tirer un prix au million de tokens, il faut savoir combien de tokens on consomme réellement. Alors je suis allé regarder chez moi.

J'ai passé au peigne fin les journaux de mes sessions Claude Code, dans ~/.claude/projects : 724 fichiers, du 28 juillet au 11 août 2026. Le script fait la somme des tokens déclarés par l'API dans chaque réponse et applique la grille Anthropic. Verdict :

Période mesurée14 jours (28/07 au 11/08/2026)
Tokens consommés5,85 milliards
Ce que ça coûterait à l'API4 867 $, soit environ 10 400 $ par mois
Coût horaire équivalent17,24 $ de l'heure de session
Coût moyen au million0,83 $ et pas 5 $, ni 25 $

Ce dernier chiffre est le cœur du sujet. Claude Opus 5 est facturé 5 dollars le million de tokens en entrée et 25 en sortie. Mon coût réel ressort à 0,83 dollar. Pourquoi ? Parce que la ventilation de ce que consomme un agent de code n'a rien à voir avec ce qu'on imagine :

Type de tokenPart réelleTarifé
Lecture de cache95,81 %0,1 fois le prix d'entrée
Écriture de cache3,60 %1,25 fois le prix d'entrée
Sortie (le code écrit)0,55 %plein tarif de sortie
Entrée non cachée0,04 %plein tarif d'entrée

Un agent de code passe son temps à relire le même dépôt. Ces relectures sont servies par le cache (une copie de ton contexte que le fournisseur garde au chaud et facture dix fois moins cher), et elles écrasent tout le reste. La sortie, le vrai code produit, c'est un demi pour cent du volume. Tous les comparatifs qui posent un mix « 70 % entrée, 30 % sortie » se trompent d'un facteur 5 sur le prix final.

D'où la colonne que j'utilise partout dans les tableaux qui suivent : le coût effectif au million, calculé en appliquant ce mix mesuré à la grille de chaque éditeur. La formule tient en une ligne, tu peux refaire le calcul toi-même :

coût_effectif = prix_entrée × 0,1412 + prix_sortie × 0,005524

Deux réserves, et je préfère les dire tout de suite. Un : mon usage est extrême, j'orchestre des sous-agents en parallèle, donc mes volumes sont ceux d'un cas limite, pas d'un développeur moyen. Deux : je n'ai pas testé les quarante offres de cet article. J'utilise Claude Code au quotidien et j'ai bricolé avec Ollama, le reste vient des grilles officielles et des documentations. Je le signale à chaque fois que ça compte.

Le tableau maître : tout, du plus intelligent au moins intelligent

Classement par capacité en code, du haut vers le bas. L'indice est le mien, composé à partir de SWE-bench Verified et SWE-bench Pro relevés sur BenchLM au 10 août 2026, complété par mon ressenti d'usage quand le score public manque. Les estimations sont marquées d'une astérisque.

ModèleIndiceSWE-b. V.Accès$/Mtok effectifEntrée mensuelle
Claude Opus 510096,0 %API + abonnement0,84 $20 $
Claude Mythos 59995,5 %API, accès restreint1,69 $n.c.
Claude Fable 59895,0 %API + abonnement1,69 $100 $
Claude Opus 4.89088,6 %API + abonnement0,84 $20 $
GPT-5.6 Sol88*n.c.API + abonnement0,87 $20 $
Claude Sonnet 58685,2 %API + abonnement0,51 $
0,34 $ jusqu'au 31/08
20 $
GPT-5.6 Terra84*n.c.API + abonnement0,35 $20 $
GPT-5.3 Codex82*n.c.API + abonnement0,32 $20 $
Gemini 3.1 Pro80*n.c.API + abonnement0,35 $100 $
Kimi K378*n.c.API, poids ouverts0,51 $n.c.
GLM-5.276*n.c.API + abonnement0,22 $18 $
Grok 4.575*n.c.API + abonnement0,32 $30 $
DeepSeek V4 Pro74*n.c.API, poids ouverts0,024 $à l'usage
Kimi K2.7 Code72*n.c.API, poids ouverts0,16 $à l'usage
GLM-4.770*n.c.API, poids ouverts0,10 $à l'usage
Qwen3 Coder Next66*n.c.API, poids ouverts0,020 $à l'usage
Qwen3-Coder 30B (local)55*n.c.Ollama, sur ta machineélectricité0 $
GLM-4.7 Flash (local)48*n.c.Ollama, sur ta machineélectricité0 $

Indice sur 100, composé à partir de SWE-bench Verified et SWE-bench Pro (BenchLM, 10 août 2026). Les valeurs marquées d'une astérisque sont mes estimations, faute de score public sur ces deux tests. Le coût effectif applique le mix mesuré plus haut. n.c. veut dire non communiqué, jamais « je n'ai pas cherché ».

Une remarque honnête sur ce classement : les leaderboards ne sont pas d'accord entre eux. BenchLM met Opus 5 en tête à 96 %, CodeSOTA donne Fable 5 à 95 % et un Mythos Preview à 93,9 %. Un écart de deux points entre deux tables qui mesurent censément la même chose, ça dit surtout qu'il ne faut pas jouer les décimales. L'ordre de grandeur est fiable, le classement au dixième près ne l'est pas.

Les abonnements : ce que tu paies vraiment le million

C'est ici que la méthode devient nécessaire. Deux colonnes : ce que ça coûte si tu tapes dans tes limites (colonne « saturé », le chiffre dont les vendeurs se servent), et ce que ça coûte à un rythme réaliste. Mon volume de référence pour la colonne réaliste est de 1 500 millions de tokens par mois, ce qui correspond à peu près à 6 heures d'agent par jour ouvré.

Offre$/moisPlafond documenté$/Mtok saturé$/Mtok réaliste
Claude Pro20 $
17 $ en annuel
non publié, ~40-80 h/sem~0,01 $plafond atteint
Claude Max 5x100 $non publié, ~140-280 h/sem~0,014 $0,067 $
Claude Max 20x200 $non publié, ~240-480 h/sem0,016 $
mesuré chez moi
0,13 $
GLM Coding Lite18 $43 à 87 Mtok/sem, publié0,048 à 0,097 $plafond atteint
GLM Coding Pro72 $263 à 526 Mtok/sem, publié0,032 à 0,063 $0,048 $
GLM Coding Max160 $613 à 1226 Mtok/sem, publié0,030 à 0,060 $0,107 $
ChatGPT Plus20 $non publié, fenêtres de 5 hn.c.plafond atteint
ChatGPT Pro100 ou 200 $non publién.c.0,067 à 0,13 $
Google AI Ultra 5x99,99 $multiplicateur, pas de tokensn.c.0,067 $
SuperGrok30 $limites hebdomadairesn.c.0,020 $
GitHub Copilot Pro10 $15 $ de crédits inclusau prix APIau prix API
GitHub Copilot Max100 $200 $ de crédits inclusmoitié prix APImoitié prix API
Cursor Pro20 $500 requêtes rapides/moisn.c.n.c.
Le Chat Pro14,99 $non publién.c.n.c.

Avantages et inconvénients, en vrac. Claude Max 20x est de loin le meilleur rapport tokens sur dollar du marché quand on le sature, mais 200 dollars par mois, ça se justifie devant un comptable. GLM Coding Plan est le seul éditeur qui publie une équivalence officielle en tokens, ce qui est courageux et devrait être la norme : les autres se cachent derrière des « fenêtres de 5 heures » invérifiables. GitHub Copilot a changé de modèle le 1er juin 2026 et facture désormais à l'usage, avec un crédit valant un centime, ce qui en fait plus une API déguisée qu'un forfait. Cursor limite en requêtes et pas en tokens, un compteur qui ne veut rien dire quand une requête peut brasser 200 000 tokens de contexte.

Le chiffre qui m'a fait tiquer, c'est le mien. Sur 14 jours j'ai consommé l'équivalent de 4 867 dollars d'API. Rapporté à un abonnement Max 20x, ça fait un rapport de 52 pour 1. Aucun forfait au monde ne peut être rentable sur ce profil, ce qui veut dire une chose simple : soit Anthropic subventionne massivement, soit les plafonds sont là pour que très peu de gens y arrivent. Probablement les deux.

Les API à la carte : le tableau de vérité

Ici, pas d'estimation ni de plafond flou. Ce sont des grilles publiques. J'ajoute la colonne du coût effectif, celle qui compte réellement pour un agent de code.

ModèleEntréeCacheSortieContexteEffectif
Claude Fable 510,00 $1,00 $50,00 $1M1,69 $
Claude Opus 55,00 $0,50 $25,00 $1M0,84 $
GPT-5.6 Sol5,00 $0,50 $30,00 $n.c.0,87 $
GPT-5.5 Pro30,00 $aucun180,00 $n.c.5,23 $
Claude Sonnet 53,00 $0,30 $15,00 $1M0,51 $
GPT-5.42,50 $0,25 $15,00 $n.c.0,44 $
Gemini 3.1 Pro2,00 $0,20 $12,00 $200k+0,35 $
Grok 4.52,00 $0,30 $6,00 $500k0,32 $
GPT-5.3 Codex1,75 $0,175 $14,00 $n.c.0,32 $
GLM-5.21,40 $0,14 $4,40 $n.c.0,22 $
Claude Haiku 4.51,00 $0,10 $5,00 $200K0,17 $
Kimi K2.7 Code0,95 $n.c.4,00 $n.c.0,16 $
GLM-4.70,60 $0,06 $2,20 $n.c.0,10 $
DeepSeek V4 Pro0,435 $0,0036 $0,87 $1M0,024 $
Qwen3.7 Plus0,32 $n.c.1,28 $n.c.0,052 $
MiniMax M20,255 $n.c.1,02 $n.c.0,042 $
DeepSeek V4 Flash0,14 $0,0028 $0,28 $1M0,009 $
Qwen3 Coder Next0,11 $n.c.0,80 $n.c.0,020 $
GLM-4.7 Flashgratuitgratuitgratuitn.c.0 $

Prix en dollars par million de tokens. La colonne « Cache » est le tarif de lecture, généralement un dixième de l'entrée. Attention aux tarifs conditionnels : Grok et Gemini doublent au-delà de 200 000 tokens de contexte, Qwen3 Coder Plus a quatre paliers selon la longueur d'entrée. Et le tarif d'introduction de Claude Sonnet 5 (2 $ / 10 $) expire le 31 août 2026, après quoi il remonte à 3 $ / 15 $.

Trois choses sautent aux yeux. D'abord, DeepSeek facture sa lecture de cache à 0,0028 dollar, soit deux pour cent du prix d'entrée, là où tout le monde applique dix pour cent. Sur un agent de code qui relit son contexte en boucle, cet écart de tarification est plus décisif que le prix affiché. DeepSeek V4 Flash ressort à moins d'un centime le million effectif, c'est-à-dire 90 fois moins cher qu'Opus 5. La documentation prévient toutefois qu'une hausse significative est prévue, donc ne construis pas ton business plan dessus.

Ensuite, GPT-5.5 Pro et GPT-5.4 Pro à 30 dollars l'entrée et 180 la sortie n'ont aucun tarif de cache. Sur un agent, c'est éliminatoire : 5,23 dollars le million effectif, soit six fois Opus 5 qui fait mieux en code. Ces modèles sont conçus pour du raisonnement ponctuel, pas pour boucler sur un dépôt.

Enfin, GLM-4.7 Flash est gratuit. Pas « offre de lancement », gratuit dans la grille officielle. Je n'ai pas encore poussé un vrai projet dessus, mais pour du scaffolding et des tâches mécaniques c'est difficile à battre.

Balance a plateaux en laiton sur fond sombre, un plateau plus bas que l autre

Tout l'exercice tient là-dedans : d'un côté ce que ça coûte, de l'autre ce que ça sait faire. Aucune offre ne gagne sur les deux plateaux.

Les agrégateurs : ce qu'ils prennent au passage

Un agrégateur, c'est un intermédiaire qui te donne un seul compte et une seule facture pour cinquante modèles de quinze éditeurs. La question qui fâche, c'est sa marge.

PlateformeMarge sur l'inférenceAutres fraisCe qu'on achète
OpenRouter0 %, prix répercutés tels quels5,5 % à l'achat de crédits (min. 0,80 $), 5 % en crypto, 5 % en clés perso au-delà de 25 000 $/moisUn compte pour tout, bascule de modèle à chaud, pas de limite de débit par éditeur
Together AIGrille propre, parfois au-dessus de l'éditeuraucun frais d'entréeModèles à poids ouverts, hébergement dédié possible
Fireworks AIn.c.n.c.Paliers standard, priorité et rapide. Grille renvoyée vers la doc, je n'ai pas pu la relever proprement
Groq / Cerebrasn.c.n.c.Vitesse d'inférence hors norme sur matériel dédié, catalogue restreint
Hugging Facen.c.n.c.Le plus large catalogue de modèles ouverts, orienté expérimentation

La bonne surprise, c'est OpenRouter : zéro marge sur l'inférence, la documentation le dit noir sur blanc. Ils se rémunèrent sur le rechargement de crédits, à 5,5 %. Concrètement, tu paies le prix éditeur plus 5,5 % d'entrée de jeu, et en échange tu changes de modèle en modifiant une chaîne de caractères. Pour tester quinze modèles avant de choisir, c'est imbattable. Pour de la production à gros volume sur un seul modèle, va direct chez l'éditeur.

Les trois lignes à n.c. me gênent et je préfère l'écrire : Fireworks renvoie sa grille vers sa documentation plutôt que de l'afficher, et je n'ai pas voulu recopier des chiffres de seconde main pour boucher le trou. Un tableau avec un trou honnête vaut mieux qu'un tableau plein de suppositions.

Le local : gratuit, mais pas sans contrepartie

Ollama reste gratuit et illimité pour les modèles qui tournent sur ta machine. Ce sont les modèles cloud qui sont facturés, avec un palier gratuit, un Pro à 20 dollars et un Max à 100.

Modèle localIndiceVRAMDébit RTX 4090Mon avis
Qwen3-Coder 30B55*19 Go40 à 60 tok/sLe meilleur choix en local. Architecture à experts, 3,3 milliards de paramètres actifs seulement, donc rapide malgré sa taille. 256K de contexte, ce qui est énorme pour du local. Il faut une carte 24 Go
GLM-4.7 Flash48*19 Gon.c.198K de contexte, même gabarit. Alternative crédible, et il existe aussi en API gratuite si tu ne veux pas mobiliser ta carte
Qwen3.6 27B50*17 Go~30 tok/sModèle dense, donc tous les paramètres travaillent à chaque token. Presque deux fois plus lent que le 30B pour un résultat comparable
Kimi, DeepSeek complets70+*200 Go et plustrès lentTrès bien sur le papier, mais impraticable sur un PC de développeur : il faut une station à plusieurs cartes ou un Mac à 128 Go de mémoire unifiée, et ça reste poussif. À réserver à la curiosité

Le vrai coût du local, ce n'est pas l'électricité (compte 350 watts sous charge, soit environ 0,10 euro de l'heure au tarif belge d'août 2026, donc quelques euros par mois). C'est la carte graphique : une 4090 d'occasion tourne autour de 1 500 euros, et amortie sur trois ans ça fait déjà 42 euros par mois, avant d'avoir écrit une ligne. Une RTX 3090 d'occasion à 700 euros fait tourner exactement les mêmes modèles 20 % moins vite et divise l'amortissement par deux.

Et l'écart de capacité est réel. Un modèle local à 19 Go se situe autour de 55 sur mon indice, contre 100 pour Opus 5. Ce n'est pas un détail de finition : c'est la différence entre un assistant qui complète ta ligne et un agent qui refactorise ton module tout seul. Le local, à mon sens, sert à trois choses : l'autocomplétion, les tâches mécaniques répétitives, et le travail sur du code qui ne doit sortir d'aucune machine. Pour le reste, l'API pas chère coûte moins que l'amortissement de la carte.

Quatre combos chiffrés, selon ton profil

C'est la partie que je garderais si je devais n'en garder qu'une. Les tableaux du dessus donnent des prix, mais personne n'achète un prix : on achète une pile.

1. Étudiant ou projet perso, 0 $ par mois

GLM-4.7 Flash en API0 $le gros du travail
Ollama en local0 $autocomplétion, hors ligne
Total0 $Ce qu'on y perd : les tâches vraiment difficiles bloquent, et il faut savoir reprendre la main

2. Développeur indépendant, environ 58 $ par mois

Claude Pro20 $architecture, revue, finition
GLM Coding Lite18 $le volume, les boucles longues
DeepSeek V4 Flash en API~20 $débordements, traitements par lots
Total58 $Ce qu'on y perd : il faut jongler entre trois outils et savoir quoi envoyer où

C'est la combinaison dont on parle le plus, et à raison : 20 dollars de Claude Pro achètent le jugement, 18 dollars de GLM achètent le volume. Tu fais poser la base par le modèle bon marché et tu fais peaufiner par le bon. À 20 dollars, DeepSeek V4 Flash te donne, au tarif effectif, plus de deux milliards de tokens de débordement. Oui, deux milliards.

3. Développeur à plein temps sur l'IA, environ 272 $ par mois

Claude Max 20x200 $le moteur principal, sans compter
GLM Coding Pro72 $le second moteur, en parallèle
Total272 $Ce qu'on y perd : rien, sauf 272 dollars. À ce niveau on paie pour ne plus penser au compteur

C'est à peu près ma pile, et le calcul est vite fait : ce que je consomme coûterait environ 10 400 dollars par mois à l'API. Même en divisant par cinq pour un usage moins agressif, l'abonnement reste rentable d'un facteur dix. Sur ce profil, l'API à la carte n'a aucun sens.

4. Petite équipe de cinq développeurs, environ 190 $ par mois

Copilot Business, 5 sièges95 $autocomplétion et intégration dans les dépôts
GLM Coding Pro partagé72 $l'agent lourd sur les gros chantiers
Crédits API de secours~23 $via OpenRouter, pour tester sans multiplier les comptes
Total190 $Ce qu'on y perd : pas d'accès aux modèles de tête pour tout le monde en permanence

Ce que je retiens

Le prix affiché d'un modèle ne dit presque rien de ce que tu vas payer. Ce qui compte, c'est le tarif de lecture de cache, parce que c'est 96 % de ce qu'un agent de code consomme. Deux modèles au même prix affiché peuvent finir à un rapport de 1 à 5 selon leur politique de cache, et un modèle sans cache du tout est disqualifié d'office quel que soit son score.

Ensuite, l'écart de prix entre le haut et le bas du tableau est de l'ordre de 90 fois, alors que l'écart de capacité en code est de l'ordre de deux. Ça ne veut pas dire que le haut de gamme ne vaut rien : sur une tâche que le petit modèle rate, le prix au token n'a aucune importance, seul compte le fait que ça passe ou non. Mais ça veut dire qu'envoyer chaque tâche au modèle le plus cher est un gaspillage. La bonne pile en met deux ou trois côte à côte.

Enfin, si tu ne devais retenir qu'un chiffre : entre 40 et 60 dollars par mois, un développeur indépendant a aujourd'hui accès à une puissance qui coûtait plusieurs milliers de dollars il y a un an. Le débat n'est plus « est-ce que ça vaut le coup », il est « quelle combinaison ».

Tous les tarifs relevés le 11 août 2026 sur les pages officielles des éditeurs. Les prix sont en dollars américains, hors TVA (comptez 21 % en Belgique sur les abonnements grand public ; au taux du jour, 1 dollar vaut environ 0,92 euro). Mesures de consommation réalisées sur mes propres journaux de session Claude Code, du 28 juillet au 11 août 2026. Le tarif d'introduction de Claude Sonnet 5 expire le 31 août 2026 : je mettrai le tableau à jour début septembre.

Rejoignez la conversation

Vous devez avoir un compte pour commenter cet article. La création est gratuite et prend moins d'une minute.

  • Le fichier XMLTV à télécharger gratuitement, chaque jour
  • Commenter les articles et répondre aux autres lecteurs
  • Être averti par e-mail des nouveaux articles que vous suivez

Aucun commentaire pour le moment.

Une erreur s'est produite. Cette application peut ne plus répondre jusqu'à ce qu'elle soit rechargée.Veuillez contacter l'auteur. Reload 🗙