Claude Sonnet 5.5 bat Opus 5.5 sur Terminal-Bench pour deux fois moins cher
Claude Sonnet 5.5 accélère le code et le support à moindre coût. Découvrez ses prix, benchmarks, niveaux d'effort et critères de choix pour votre PME.
10,3 %. C'est le score de Claude Sonnet 5 sur Terminal-Bench 4.0, le test de référence du code agentique. Son successeur, Claude Sonnet 5.5, dévoilé par Anthropic le 28 septembre 2026, affiche 70,6 %. C'est plus qu'Opus 5.5 (66,4 %), le modèle haut de gamme de la maison, sorti six jours plus tôt et vendu deux fois plus cher.
Le petit modèle vient-il de détrôner le grand ? Nous avons vérifié chaque chiffre à la source, dans l'annonce officielle d'Anthropic. Voici ce que Sonnet 5.5 change vraiment, ce qu'il coûte, là où il rattrape Opus et là où, surprise, il reste derrière.
Ce qu'Anthropic vient de lâcher (et pourquoi le prix change tout)
Sonnet 5.5 est le deuxième modèle de la famille Claude 5.5, après Opus 5.5 le 22 septembre. Il est disponible dès maintenant sur claude.ai et dans les applications Claude, dans l'API (claude-sonnet-5-5), sur AWS, Google Cloud et Microsoft Azure, avec une option de rétention zéro des données. Haiku 5.5, le modèle pour les gros volumes à petit budget, est annoncé « dans les semaines à venir ».
Le prix, lui, ne bouge pas : 2 $ par million de tokens en entrée, 10 $ en sortie, exactement comme Sonnet 5. Soit la moitié du tarif d'Opus 5.5.

Mais le vrai argument n'est pas le tarif unitaire. Anthropic annonce un modèle plus de 30 % plus rapide que Sonnet 5 et jusqu'à 30 % moins cher par tâche, parce qu'il consomme moins de tokens et enchaîne moins d'appels d'outils pour arriver au résultat. Même prix au token, facture plus légère à la tâche.
Des benchmarks qui font mal à Opus
Voici le tableau publié par Anthropic, sans retouche. La colonne encadrée est celle de Sonnet 5.5.

Trois lignes sautent aux yeux :
- Terminal-Bench 4.0 (code agentique en terminal) : 70,6 % pour Sonnet 5.5, devant Opus 5.5 (66,4 %). Sonnet 5 plafonnait à 10,3 % : le score est multiplié par près de sept en une génération.
- OSWorld 2.1 (pilotage d'un ordinateur, score partiel) : 80,1 %, à 1,7 point d'Opus 5.5 (81,8 %), contre 57,0 % pour Sonnet 5.
- GDPval-AA v2.1 (travail de bureau professionnel) : 1844 contre 1846 pour Opus 5.5. Deux points d'écart, autant dire l'égalité. GPT-6 Sol, le modèle d'OpenAI, est mesuré à 1487 sur ce même test.
Autre saut spectaculaire : en lecture de graphiques (Chartography, sans outils), Sonnet 5.5 passe de 15,6 % à 61,6 %. Le modèle qui lit vos tableaux de bord n'est plus le même.
Le graphique qui résume tout : la performance par dollar
Le tableau ne dit pas combien coûte chaque point. Anthropic publie aussi la courbe score contre coût de Terminal-Bench 4.0, niveau d'effort par niveau d'effort :

La lecture est brutale pour l'ancienne génération : en effort Medium, le réglage par défaut des applications Claude, Sonnet 5.5 dépasse largement le meilleur score de Sonnet 5 pour moins d'un dixième du coût par tâche, selon Anthropic.
Le détail qui pique : Opus reste le patron sur le travail complexe
Avant de résilier votre accès à Opus, regardez le reste du tableau. Opus 5.5 garde l'avantage sur FrontierCode 1.1 (54,4 % contre 46,2 %), sur CursorBench 4.0 (57,8 % contre 55,5 %) et sur Humanity's Last Exam avec outils (67,7 % contre 64,5 %). Sur FrontierCode, GPT-6 Sol (49,3 %) passe même devant Sonnet 5.5.
Et le fameux 70,6 % a un prix. Il est obtenu en effort Max : sur le graphique d'Anthropic, c'est le point le plus cher de la courbe de Sonnet 5.5, plus cher par tentative que le meilleur score d'Opus 5.5. Plus d'effort n'est d'ailleurs pas toujours mieux : sur FrontierCode, Sonnet 5.5 fait 52,1 % en effort Xhigh mais retombe à 46,2 % en Max, parce qu'il multiplie les modifications hors du périmètre demandé.
Anthropic le reconnaît lui-même : Opus 5.5 reste « nettement plus fort sur le travail complexe et ouvert qui demande un jugement soutenu ». Sonnet 5.5 rattrape Opus sur les tâches cadrées. Il ne le remplace pas partout.
Plus rapide, et ça se voit à l'œil nu
Anthropic a mis les deux générations côte à côte sur la même consigne : coder une nuée de 400 étourneaux dans un seul fichier HTML. Au moment de la capture, Sonnet 5 écrit encore son code. Sonnet 5.5 a déjà fini, et ses oiseaux volent depuis 12 secondes.

Les premiers clients mesurent la même chose sur leurs propres tâches (citations traduites de l'anglais) :
- Lovable : « un tiers d'appels d'outils en moins et environ deux fois moins de commandes shell pour terminer une tâche », selon Fabian Hedin, cofondateur et CTO.
- Zendesk : des tickets de support « traités 20 % plus vite », rapporte Abhinay Kathuria, directeur de l'IA.
- Slack : sans changer un seul prompt, de meilleurs résultats que Sonnet 5 sur presque toutes ses évaluations, « en moins d'étapes et avec environ 14 % de tokens de sortie en moins », selon Curtis Allen, Principal Engineer.
Chez Epic Games, Daniel Vogel, directeur des opérations, va plus loin : Sonnet 5.5 « a franchi la même barre de qualité que celle qu'on attendrait d'un modèle de gamme supérieure » sur un audit de conception système.
Ce que ça change pour votre entreprise
La règle devient simple : Sonnet 5.5 par défaut, Opus 5.5 pour les exceptions.
- Sonnet 5.5 pour le volume : corrections de bugs cadrées, revues de code, documents, slides, tableurs, réponses de support. Partout où le délai et le coût par tâche comptent.
- Opus 5.5 pour ce qui engage : décisions d'architecture, migrations floues, problèmes ouverts qui demandent un jugement soutenu.
Le réglage d'effort, de Low à Max, devient votre vrai levier de coût. Par défaut, il est sur Medium dans Claude Code et les applications, et sur High dans la Claude Platform. Pour une mise en forme répétitive, restez bas. Pour une analyse où la cohérence des données compte, montez. Un point pour vos équipes techniques : si vous utilisiez Sonnet sans réflexion préalable (« thinking » désactivé), il faut passer au nouveau réglage between_tools avant de migrer.
Côté sécurité, Sonnet 5.5 est le premier Sonnet livré avec des protections cyber du niveau des modèles de frontière, et avec des classifieurs qui bloquent l'extraction de son raisonnement. La rétention zéro des données ne dispense pas pour autant de gouverner les accès, les secrets et les données sensibles : c'est le rôle de vos environnements cloud et DevOps.
Reste la seule question qui compte : combien vous coûte une tâche livrée, chez vous ? Un audit et cadrage sur quelques tâches de code, de documents et de support suffit pour le mesurer. L'automatisation et l'IA prennent ensuite le relais sur ce qui passe le test, avec notre méthode : partir de la tâche, jamais du modèle.
Sur le papier, Opus reste le plus fort. Sur la facture, Sonnet vient de passer devant.
Sources
- Introducing Claude Sonnet 5.5, Anthropic
- Introducing Claude Opus 5.5, Anthropic
- Anthropic releases Sonnet 5.5, TechCrunch
- Anthropic debuts Claude Sonnet 5.5, SiliconANGLE
- Sonnet 5.5, cyber protections and distillation, The Next Web
- Anthropic Claude Sonnet 5.5, Help Net Security
