Kimi K3, GPT-5.6, Grok 4.5, Opus 5 : juillet 2026, le mois où l'IA a pété les plombs
Vous êtes partis en vacances début juillet ? Mauvaise idée. Pendant que vous étaliez la crème solaire, l'industrie de l'IA a décidé de sortir quatre modèles frontière en trois semaines. OpenAI, xAI, Moonshot AI et Anthropic se sont livrés à un festival de « tiens, prends ça » qui ressemble moins à un marché tech qu'à une partie de poker où tout le monde fait tapis en même temps. Installez-vous, on vous résume la bagarre, chiffres vérifiés et comparatif complet à l'appui.

9 juillet : OpenAI dégaine GPT-5.6 en trois saveurs
OpenAI ouvre le bal avec GPT-5.6, décliné en trois variantes comme un menu de food-truck : Sol (le raisonnement haut de gamme, code et science), Terra (la qualité du 5.5 à moitié prix) et Luna (le volume rapide et pas cher). Sol impressionne surtout en agentique : 91,9 % sur Terminal-Bench 2.0 et un score global BenchAlign de 81,96. Fenêtre de contexte de 1,05 million de tokens, facturé 5 $ en entrée et 30 $ en sortie par million de tokens. Sérieux, efficace, cher en sortie. Du OpenAI dans le texte.
16 juillet, double détente : Grok 4.5 et le monstre Kimi K3
Une semaine plus tard, deux sorties le même jour (le hasard n'existe pas dans cette industrie). D'abord Grok 4.5 de xAI : moins fort que Sol sur la plupart des benchmarks (BenchAlign 76,72, Terminal-Bench 83,3 %), mais leader sur SWE-Bench Pro et surtout facturé 2 $/6 $, environ 4 fois moins cher que Sol par token. Le rapport qualité-prix qui fait mal.
Et puis il y a Kimi K3 de Moonshot AI, et là on change de catégorie. 2 800 milliards de paramètres, le plus grand modèle open-weight jamais publié. L'astuce pour que ça ne coûte pas un PIB à faire tourner : une architecture Mixture-of-Experts avec 896 experts dont seulement 16 activés par token. Un cerveau énorme qui ne mobilise que les neurones utiles, en somme (on connaît tous quelqu'un qui fait l'inverse). Ajoutez le mécanisme d'attention hybride KDA (3 couches d'attention linéaire pour 1 couche complète), un contexte d'un million de tokens, du multimodal natif texte/image/vidéo, et une quantification MXFP4 qui fait tenir le tout dans ~1,4 To.
Le clou du spectacle : K3 décroche la première place mondiale sur le Frontend Code Arena (1 679 points), devant Claude Fable 5 (1 631). Un modèle bientôt téléchargeable qui bat le champion propriétaire sur le code frontend, c'est une première historique. Et les poids complets arrivent le 27 juillet sous licence MIT modifiée. Avant de vider votre disque dur pour l'occasion, lisez quand même la section « je peux le faire tourner chez moi ? » plus bas : le réveil est brutal.
24 juillet : Anthropic répond avec Opus 5
On pensait le mois terminé, et Anthropic a sorti l'artillerie : Claude Opus 5, positionné comme le modèle du quotidien qui frôle le flagship Fable 5... à moitié prix (5 $/25 $ par million de tokens, contre 10 $/50 $ pour Fable 5). Et les chiffres ne sont pas là pour décorer :
- Frontier-Bench : 43,3 %, plus du double d'Opus 4.8 (18,7 %) et près de 10 points devant Fable 5 (33,7 %). Oui, devant le grand frère.
- ARC-AGI 3 (intelligence fluide) : 30,2 %, quand GPT-5.6 Sol plafonne à 7,8 % et Opus 4.8 à 1,5 %. L'écart est brutal.
- CursorBench 3.2 : à 0,5 % du score maximal de Fable 5, pour environ deux fois moins cher par tâche.
Ajoutez un contexte d'1 million de tokens et un réglage d'effort low/medium/high pour doser le rapport coût/matière grise à chaque requête. Anthropic vend littéralement du « presque-flagship » au prix du milieu de gamme. Les comptables des boîtes tech ont dû verser une petite larme de joie.
Le grand comparatif
Parce qu'un tableau vaut mieux que trois paragraphes de plus :
| Kimi K3 | GPT-5.6 Sol | Grok 4.5 | Claude Opus 5 | |
|---|---|---|---|---|
| Éditeur | Moonshot AI | OpenAI | xAI | Anthropic |
| Sortie | 16 juillet | 9 juillet | 16 juillet | 24 juillet |
| Architecture | MoE 2,8T (16/896 experts) | n.c. | n.c. | n.c. |
| Contexte | 1M tokens | 1,05M tokens | 500K tokens | 1M tokens |
| Prix (in/out par M tokens) | 3 $ / 15 $ | 5 $ / 30 $ | 2 $ / 6 $ | 5 $ / 25 $ |
| Poids ouverts | Oui, le 27/07 (MIT modifiée) | Non | Non | Non |
| Point fort | n°1 code frontend (Arena 1 679) | agentique (Terminal-Bench 91,9 %) | rapport qualité/prix | ARC-AGI 3 (30,2 %), code SOTA |

Sur les tâches professionnelles réelles (GDPval-AA v2, 44 métiers, 9 industries), la hiérarchie reste : Claude Fable 5 Max (1 815) devant GPT-5.6 Sol Max (1 747,8) et Kimi K3 (1 687). Mais un modèle open-weight dans le top 3 mondial, il fallait oser le pronostiquer en janvier.
« Et moi, avec mon Mac ou mon PC, je peux le faire tourner ? »
C'est LA question qui revient dès qu'on prononce les mots « poids ouverts ». Réponse courte : non. Réponse longue : non, mais installez-vous, parce qu'il y a plein de choses intéressantes à dire, et surtout des solutions de repli tout à fait honorables.
Pourquoi « seulement 16 experts actifs » ne sauve pas votre machine
Le malentendu classique : « c'est du Mixture-of-Experts, donc seuls 16 experts sur 896 travaillent, donc ça tient sur mon GPU ». Eh non. Le routage se décide token par token, et personne ne sait à l'avance quels experts seront appelés au token suivant. Résultat : tous les poids doivent être en mémoire, en permanence. Le MoE économise du calcul, pas de la mémoire. C'est un peu comme avoir une bibliothèque de 896 bouquins : vous n'en lisez que 16 à la fois, mais il faut quand même l'étagère complète chez vous.
Et l'étagère fait mal : 2 800 milliards de paramètres en MXFP4 natif (4 bits), c'est environ 1,4 To rien que pour les poids. Ajoutez le cache KV (des dizaines de Go dès qu'on parle de contexte long) et le runtime. Même une quantification 2 bits agressive (si elle sort et si elle reste utilisable) vous laisse à ~700 Go.

Le Mac Studio M4 Ultra le plus cher du catalogue, avec ses 512 Go de mémoire unifiée, plafonne à environ 2,7 fois moins que ce qu'exige K3 en 4 bits. Et sur Apple Silicon, la mémoire unifiée est partagée avec macOS, le cache KV et le moteur d'inférence. Vous ne disposez jamais du chiffre affiché sur la facture. Bref : ce n'est pas une histoire de « il faut le bon réglage », c'est une histoire de physique.
Et Ollama, alors ?
Pas encore, et ce n'est pas qu'une question de taille. K3 utilise KDA, son mécanisme d'attention hybride maison (3 couches d'attention linéaire pour 1 couche complète). Ce truc-là doit être implémenté à la main dans chaque moteur d'inférence : llama.cpp, Ollama (qui s'appuie dessus) et MLX côté Mac n'ont, à ce jour, aucun support de KDA. Tant que ce code n'existe pas, il n'y a ni GGUF, ni ollama run kimi-k3, quelle que soit votre RAM. Les moteurs qui font tourner K3 aujourd'hui sont vLLM et SGLang, sur des serveurs multi-GPU avec interconnexion haut débit, le genre de machine qui a son propre disjoncteur.
Ce que vous pouvez réellement faire, ce week-end
| Votre machine | Ce qui est possible |
|---|---|
| Portable / PC standard (8 à 32 Go) | K3 via le cloud uniquement : kimi.com, l'API Moonshot ou OpenRouter (moonshotai/kimi-k3, API compatible OpenAI). En local, visez un modèle de 7 à 32 B : c'est là que se joue le vrai plaisir du offline. |
| Mac 36 à 128 Go (M4/M5 Pro ou Max) | Excellent terrain pour les modèles 27 à 70 B quantifiés via Ollama, LM Studio ou MLX. Un Qwen3.6-27B tourne confortablement sur 24 à 32 Go et reste à ce jour le meilleur score de code qu'on puisse tenir dans ses mains. K3 : non. |
| Mac Studio 256 à 512 Go | Le club VIP du LLM local : Kimi K2.6 en Q4 tourne entre 20 et 32 tokens/s via MLX ou llama.cpp (240 à 600 Go selon la quantification). Toujours pas K3, mais c'est le modèle Moonshot le plus proche que vous puissiez héberger. |
| PC gamer (RTX 5090, 32 Go VRAM) | Redoutable jusqu'à ~30 B en 4 bits, avec des vitesses que les Mac n'atteignent pas. Au-delà, le déchargement en RAM système transforme votre chatbot en correspondant épistolaire. |
| Vous y tenez vraiment | Location de GPU à l'heure (RunPod, Vast.ai, Lambda) : un nœud 8×H200 avec vLLM ou SGLang. Comptez plusieurs dollars de l'heure, et 1,4 To à télécharger avant de dire bonjour au modèle. |
La configuration que recommandent la plupart des équipes en 2026 est hybride : un petit modèle local pour tout ce qui touche à des données sensibles ou à du volume répétitif, et l'API K3 pour les tâches difficiles. Vous gardez la souveraineté là où elle compte, sans transformer votre bureau en datacenter, et sans expliquer à votre comptable pourquoi vous avez acheté quatre Mac Studio « pour tester un truc ».
Petit rappel utile pour le 27 juillet, jour de publication des poids : prévoyez le stockage (1,4 To, ce n'est pas une clé USB), la bande passante (un téléchargement qui se compte en heures, voire en jours), et un peu de patience. Il faudra attendre que la communauté (Unsloth et consorts) publie des quantifications dynamiques et que KDA arrive dans llama.cpp. Historiquement, ça prend de quelques jours à quelques semaines. En attendant, l'API fait très bien le travail.
Alors, qui gagne ?
Réponse de Normand : ça dépend de votre portefeuille et de votre cas d'usage. Le raisonnement pur ? Opus 5 et son score ARC-AGI 3 qui humilie la concurrence. L'agentique industrielle ? GPT-5.6 Sol. Le budget serré ? Grok 4.5, imbattable au tarif. La souveraineté et le contrôle total ? Kimi K3 et ses poids ouverts dès le 27 juillet. Le vrai gagnant, c'est surtout nous : cette guerre des prix fait fondre le coût de l'inférence à vue d'œil, et pendant que les géants se tirent la bourre, la Chine démontre qu'on peut contourner les restrictions sur les puces à coups d'efficacité architecturale.
Il y a cinq ans, un seul de ces modèles aurait fait la une pendant six mois. Là, on en a eu quatre en trois semaines, et on trouve presque ça normal. Rendez-vous le 27 juillet pour le téléchargement des poids de K3, et probablement le 1er août pour la prochaine « annonce du siècle ».
Sources
- TechCrunch : Anthropic launches Opus 5
- Vellum : Claude Opus 5 Benchmarks Explained
- Tom's Hardware : Moonshot releases 2.8-trillion-parameter Kimi K3
- VentureBeat : China's Moonshot AI releases Kimi K3
- Simon Willison : Kimi K3, and what we can still learn from the pelican benchmark
- LLM-Stats : GPT-5.6 Sol vs Grok 4.5
- MindStudio : AI Model Pricing in 2026
- Modem Guides : Can You Run Kimi K3 Locally? The 2.8T Hardware Reality
- Layer3 Labs : How to Run Kimi K3 Locally: Hardware & Setup Guide
- Unsloth : Kimi K2.6: How to Run Locally (quantifications dynamiques)
- OpenRouter : moonshotai/kimi-k3
Rejoignez la conversation
Vous devez avoir un compte pour commenter cet article. La création est gratuite et prend moins d'une minute.
Aucun commentaire pour le moment.