Aller au contenu principal

Claude Code : Sonnet 5.5 fait presque aussi bien qu'Opus, faut-il changer ?


Quelle bonne nouvelle ! Anthropic nous offre un cadeau ! Le petit modèle, le petit frérot, vient de rattraper le grand, et il nous coûte deux fois moins cher. Lundi 28 septembre, Anthropic sort Claude Sonnet 5.5, et aussi dans Claude Code, ce merveilleux assistant de programmation que j'utilise du matin au soir, il remplace déjà l'ancien Sonnet 5. Sur un test de vrais travaux de bureau, il termine à deux points d'Opus 5.5, considéré comme le gros modèle de la maison (oui, et Fable aussi, le très haut de gamme au-dessus d'Opus, mais on y revient). Deux points sur plus de 1 800. Autant dire un match nul !

Alors forcément, la question qu'on se pose : est-ce que je continue à payer le grand frérot pour tout faire ?

Sur une ligne d'arrivée de course cycliste, un adolescent sur un vélo de ville à panier arrive roue dans roue avec un coureur adulte sur un vélo de course très cher, sous les yeux étonnés du public

Le vélo du grand a coûté le double

Sonnet, Opus, Haiku : trois tailles, trois prix

Petit rappel pour ceux qui ne dorment pas avec Claude. Anthropic vend son IA en trois tailles, un peu comme les gobelets au comptoir d'un café. Haiku, le petit, rapide et pas cher. Sonnet, le moyen, celui qu'on prend tous les jours. Et Opus, le grand, qui réfléchit plus longtemps et qui coûte plus cher. Le Haiku 5.5 n'est pas encore là, il est annoncé « dans les semaines qui arrivent ».

Côté prix, c'est simple : sur la grille qu'Anthropic a publiée le 28 septembre, Sonnet 5.5 coûte exactement la moitié d'Opus 5.5. Deux dollars contre quatre pour ce qu'il lit, dix contre vingt pour ce qu'il écrit, à chaque fois par million de « tokens », ces petits bouts de mots que les modèles facturent par morceau. Et c'est le même tarif que l'ancien Sonnet 5, donc à prix égal, tu as un meilleur moteur sous ton capot.

Maintenant, les notes. Je te les traduis :

Graphique en barres, chiffres publiés par Anthropic le 28 septembre 2026. Travaux de bureau, test GDPval-AA, score de type échecs : Sonnet 5 à 1 449, Sonnet 5.5 à 1 844, Opus 5.5 à 1 846. Utiliser un ordinateur tout seul, test OSWorld 2.1 : Sonnet 5 à 57 pour cent, Sonnet 5.5 à 80,1 pour cent, Opus 5.5 à 81,8 pour cent

Le moyen colle au grand, et l'ancien moyen regarde passer le train

Le premier test, GDPval-AA, fait faire à l'IA de vrais travaux de bureau, du genre tableau, présentation ou rapport, et il classe les modèles comme on classe les joueurs d'échecs. Le deuxième, OSWorld, lui confie un ordinateur et la laisse se débrouiller seule : cliquer, ouvrir des fenêtres, remplir des formulaires. Sur les deux, Sonnet 5.5 fait jeu égal avec Opus 5.5, et il laisse l'ancien Sonnet loin derrière.

Mais le chiffre qui m'a surpris, c'est celui du terminal, cette fenêtre noire où les développeurs tapent leurs commandes. Sur Terminal-Bench 4.0, un test où l'IA doit mener seule un travail de bout en bout dans cette fenêtre, l'ancien Sonnet faisait 10,3 %. Le nouveau fait 70,6 %. Presque sept fois plus ! Et il va 30 % plus vite que l'ancien, avec jusqu'à 30 % de coût en moins par tâche, parce qu'il a besoin de moins de mots pour arriver au même résultat. Ce sont des chiffres d'Anthropic, donc à prendre comme des chiffres d'entreprise, mais l'écart est trop gros pour être du maquillage.

Petit bonus rigolo : c'est le premier Sonnet qui termine Pokémon Rouge en ne regardant que des captures d'écran. Ça a l'air d'un gadget, mais tenir des heures et des heures de jeu sans perdre le fil, c'est exactement ce qui manquait aux IA sur un long chantier de code. Et entre nous, combien de gosses des années 90 sont allés jusqu'au bout ?

Et si tu ne codes pas ?

Ça te concerne quand même, et plus que tu ne le crois. Sonnet, c'est le modèle que l'appli Claude donne par défaut aux comptes gratuits et Pro depuis la sortie de Sonnet 5 en juin. Anthropic n'a pas encore écrit noir sur blanc que le 5.5 a pris sa place dans l'appli, donc le plus simple est d'ouvrir le petit menu de choix du modèle (dans Claude Code, c'est la commande /model), en bas de la zone où tu tapes ta question, et de regarder le modèle qui est sélectionné. Si c'est lui, tu as des réponses plus rapides, et un assistant qui fait tes tableaux et tes présentations presque aussi bien que le grand modèle payant.

Et surtout, tu le croiseras sans le savoir. Beaucoup d'entreprises branchent ce genre de modèle derrière leur service client, le petit chat en bas à droite du site où tu viens réclamer ton colis perdu. Zendesk, un des gros logiciels de service client, annonce dans la présentation d'Anthropic que Sonnet 5.5 traite ses demandes 20 % plus vite. Un modèle moins cher et plus rapide, c'est un service client qui répond plus vite, et des entreprises qui n'ont plus d'excuse pour te laisser poireauter.

Chez moi, Sonnet fait déjà les recherches

Dans ma configuration de Claude Code, je ne fais pas tout tourner sur le même modèle. Claude Code peut lancer des « sous-agents », des petits assistants spécialisés à qui il confie un morceau du travail. Ceux qui fouillent dans le code pour retrouver où se trouve quoi (Explore) tournent sur Sonnet 5.5, tout comme celui qui lance les tests (Tester) pour vérifier que rien n'est cassé. Tout ce qui écrit du code ou qui le juge reste sur Opus. Payer Opus pour fouiller dans des fichiers, c'est envoyer ton patron chercher un tournevis dans la camionnette.

Dans la cuisine d'un restaurant, une jeune commis découpe des carottes en dés au premier plan pendant qu'au fond, le chef en toque goûte calmement une sauce, les yeux mi-clos

Le commis épluche, le chef goûte, et personne ne paie le chef pour faire la vaisselle 

Anthropic dit d'ailleurs la même chose dans sa propre page d'aide sur Claude Code : Sonnet est le bon choix pour la grande majorité du travail de programmation, et Opus consomme nettement plus de ton quota. Je cite : « dépenser Opus sur du travail de routine, c'est le moyen le plus rapide de vider ta limite ». Celui qui a lu mon article sur le quota qui fond trop vite, il y a trois semaines, sait que ce n'est pas un détail.

Changer de modèle en cours de route, ça tient en une commande, à taper directement dans Claude Code :

/model sonnet
/model opus

Et il y a un deuxième réglage qui compte autant que le modèle : l'effort, c'est-à-dire combien de temps l'IA réfléchit avant de répondre. Quand Opus 5.5 est sorti la semaine dernière, j'ai descendu tous mes agents d'un cran, parce que ce modèle réfléchit déjà plus que l'ancien à réglage égal. Même résultat, moins de quota brûlé. Avec Sonnet 5.5, c'est la même logique : avant de monter l'effort au maximum, essaie d'abord le réglage du dessous.

Ton vieux CLAUDE.md parle peut-être à un modèle qui n'existe plus

Celle-là, je ne l'avais pas vue venir. Trois jours avant Sonnet 5.5, la version 2.1.283 de Claude Code a ajouté une commande qui fait un bilan de santé de tes consignes.

Pour ceux qui ne connaissent pas : CLAUDE.md, c'est un fichier texte que Claude Code relit à chaque démarrage. Tu y écris tes règles, tes habitudes, ce qu'il ne doit jamais faire. C'est le petit mot qu'on laisse à la baby-sitter sur le frigo.

Le problème, c'est que ce fichier a peut-être été écrit pour un enfant qui a grandi. Il y a un an, il fallait crier sur les modèles pour être obéi : « IMPORTANT » en majuscules, « réfléchis étape par étape », « tu DOIS absolument ». Les modèles d'aujourd'hui prennent tout ça au pied de la lettre et en font trop. La nouvelle commande repère ces vieilles formules, mais aussi les chemins vers des fichiers que tu as renommés depuis, les commandes qui n'existent plus, et les fichiers de consignes qui se contredisent entre eux. Elle te montre son rapport, et elle te demande avant de toucher à quoi que ce soit. Tape ceci :

claude update
/doctor prompt-audit

Un mot manuscrit pour la baby-sitter aimanté sur la porte d'un frigo, avec des consignes devenues absurdes : biberon à 22 heures, sieste après la purée, jamais seul près des escaliers. Juste à côté, la photo du bébé qu'il était. Devant le frigo, un adolescent, casque autour du cou et bol de céréales à la main, lit le mot, l'air consterné

Maman écrit à son adolescent 

J'avoue que je suis très curieux de savoir ce que ce docteur va penser de mon fichier de consignes à moi. Il a une section qui s'appelle « Règles FATAL ». En majuscules. Je crois que je connais déjà une partie du diagnostic.

Autre petite nouveauté pratique, arrivée avec Sonnet 5.5 : le mode automatique, celui où Claude Code avance sans te demander la permission à chaque geste, te pose encore la question quand il veut lire un fichier en dehors de ton projet. Avant, c'était oui ou non pour de bon. Maintenant, tu peux répondre « oui, mais redemande-moi la prochaine fois ». C'est tout bête, et c'est exactement ce qui manquait pour ne pas ouvrir la porte en grand juste parce qu'on était pressé.

Alors, on lâche Opus ?

Non. Et c'est Anthropic qui le dit : Opus 5.5 reste meilleur sur le travail flou, ouvert, celui où il faut garder son jugement pendant longtemps. Concevoir l'architecture d'un logiciel, démêler un bug que personne ne comprend, décider ce qu'on va faire avant de le faire. Là, le grand garde son avance.

Un détail que j'ai trouvé intéressant : Sonnet 5.5 est assez fort en sécurité informatique pour qu'Anthropic lui ait mis les mêmes garde-fous qu'à ses meilleurs modèles. Quand une demande devient risquée de ce côté-là, il repasse visiblement la main à l'ancien Sonnet 5. Le petit frère a eu droit aux mêmes cadenas que le grand, c'est dire s'il a grandi.

Pour moi, la règle est claire : Sonnet pour les mains, Opus pour la tête. Et je vais être honnête, ce qui me plaît le plus là-dedans, ce n'est même pas le score, c'est de pouvoir garder mes trois sessions de Claude Code ouvertes un peu plus longtemps avant que la jauge de quota passe au rouge !

Et Fable dans tout cela ? Franchement, je ne l'utilise que pour des cas très spéciaux, quand Opus ne s'en sort pas, et en tant qu'analyste architecte, il peut te sortir une solution, mais ça devient vraiment rare. Peut-être bientôt un Fable 5.5 qui déchire ? On verra bien.

Sources

Article écrit avec l'aide de Claude Code, relu et corrigé par moi.

Rejoignez la conversation

Vous devez avoir un compte pour commenter cet article. La création est gratuite et prend moins d'une minute.

  • Le fichier XMLTV à télécharger gratuitement, chaque jour
  • Commenter les articles et répondre aux autres lecteurs
  • Être averti par e-mail des nouveaux articles que vous suivez

Aucun commentaire pour le moment.

Une erreur s'est produite. Cette application peut ne plus répondre jusqu'à ce qu'elle soit rechargée.Veuillez contacter l'auteur. Reload 🗙