Aller au contenu principal
IA Générative & Agents

Claude Sonnet 5.5 bat Opus 5.5 sur Terminal-Bench pour deux fois moins cher

Claude Sonnet 5.5 accélère le code et le support à moindre coût. Découvrez ses prix, benchmarks, niveaux d'effort et critères de choix pour votre PME.

Evan PluchartEvan PluchartPublié le 29 septembre 20267 min
Résumer cet article avec une IA

10,3 %. C'est le score de Claude Sonnet 5 sur Terminal-Bench 4.0, le test de référence du code agentique. Son successeur, Claude Sonnet 5.5, dévoilé par Anthropic le 28 septembre 2026, affiche 70,6 %. C'est plus qu'Opus 5.5 (66,4 %), le modèle haut de gamme de la maison, sorti six jours plus tôt et vendu deux fois plus cher.

Le petit modèle vient-il de détrôner le grand ? Nous avons vérifié chaque chiffre à la source, dans l'annonce officielle d'Anthropic. Voici ce que Sonnet 5.5 change vraiment, ce qu'il coûte, là où il rattrape Opus et là où, surprise, il reste derrière.

Ce qu'Anthropic vient de lâcher (et pourquoi le prix change tout)

Sonnet 5.5 est le deuxième modèle de la famille Claude 5.5, après Opus 5.5 le 22 septembre. Il est disponible dès maintenant sur claude.ai et dans les applications Claude, dans l'API (claude-sonnet-5-5), sur AWS, Google Cloud et Microsoft Azure, avec une option de rétention zéro des données. Haiku 5.5, le modèle pour les gros volumes à petit budget, est annoncé « dans les semaines à venir ».

Le prix, lui, ne bouge pas : 2 $ par million de tokens en entrée, 10 $ en sortie, exactement comme Sonnet 5. Soit la moitié du tarif d'Opus 5.5.

Capture D’écran 2026 09 29 À 17.09.18

Mais le vrai argument n'est pas le tarif unitaire. Anthropic annonce un modèle plus de 30 % plus rapide que Sonnet 5 et jusqu'à 30 % moins cher par tâche, parce qu'il consomme moins de tokens et enchaîne moins d'appels d'outils pour arriver au résultat. Même prix au token, facture plus légère à la tâche.

Des benchmarks qui font mal à Opus

Voici le tableau publié par Anthropic, sans retouche. La colonne encadrée est celle de Sonnet 5.5.

Capture D’écran 2026 09 29 À 17.09.59

Trois lignes sautent aux yeux :

  • Terminal-Bench 4.0 (code agentique en terminal) : 70,6 % pour Sonnet 5.5, devant Opus 5.5 (66,4 %). Sonnet 5 plafonnait à 10,3 % : le score est multiplié par près de sept en une génération.
  • OSWorld 2.1 (pilotage d'un ordinateur, score partiel) : 80,1 %, à 1,7 point d'Opus 5.5 (81,8 %), contre 57,0 % pour Sonnet 5.
  • GDPval-AA v2.1 (travail de bureau professionnel) : 1844 contre 1846 pour Opus 5.5. Deux points d'écart, autant dire l'égalité. GPT-6 Sol, le modèle d'OpenAI, est mesuré à 1487 sur ce même test.

Autre saut spectaculaire : en lecture de graphiques (Chartography, sans outils), Sonnet 5.5 passe de 15,6 % à 61,6 %. Le modèle qui lit vos tableaux de bord n'est plus le même.

Le graphique qui résume tout : la performance par dollar

Le tableau ne dit pas combien coûte chaque point. Anthropic publie aussi la courbe score contre coût de Terminal-Bench 4.0, niveau d'effort par niveau d'effort :

Capture D’écran 2026 09 29 À 17.10.24

La lecture est brutale pour l'ancienne génération : en effort Medium, le réglage par défaut des applications Claude, Sonnet 5.5 dépasse largement le meilleur score de Sonnet 5 pour moins d'un dixième du coût par tâche, selon Anthropic.

Le détail qui pique : Opus reste le patron sur le travail complexe

Avant de résilier votre accès à Opus, regardez le reste du tableau. Opus 5.5 garde l'avantage sur FrontierCode 1.1 (54,4 % contre 46,2 %), sur CursorBench 4.0 (57,8 % contre 55,5 %) et sur Humanity's Last Exam avec outils (67,7 % contre 64,5 %). Sur FrontierCode, GPT-6 Sol (49,3 %) passe même devant Sonnet 5.5.

Et le fameux 70,6 % a un prix. Il est obtenu en effort Max : sur le graphique d'Anthropic, c'est le point le plus cher de la courbe de Sonnet 5.5, plus cher par tentative que le meilleur score d'Opus 5.5. Plus d'effort n'est d'ailleurs pas toujours mieux : sur FrontierCode, Sonnet 5.5 fait 52,1 % en effort Xhigh mais retombe à 46,2 % en Max, parce qu'il multiplie les modifications hors du périmètre demandé.

Anthropic le reconnaît lui-même : Opus 5.5 reste « nettement plus fort sur le travail complexe et ouvert qui demande un jugement soutenu ». Sonnet 5.5 rattrape Opus sur les tâches cadrées. Il ne le remplace pas partout.

Plus rapide, et ça se voit à l'œil nu

Anthropic a mis les deux générations côte à côte sur la même consigne : coder une nuée de 400 étourneaux dans un seul fichier HTML. Au moment de la capture, Sonnet 5 écrit encore son code. Sonnet 5.5 a déjà fini, et ses oiseaux volent depuis 12 secondes.

Capture D’écran 2026 09 29 À 17.11.16

Les premiers clients mesurent la même chose sur leurs propres tâches (citations traduites de l'anglais) :

  • Lovable : « un tiers d'appels d'outils en moins et environ deux fois moins de commandes shell pour terminer une tâche », selon Fabian Hedin, cofondateur et CTO.
  • Zendesk : des tickets de support « traités 20 % plus vite », rapporte Abhinay Kathuria, directeur de l'IA.
  • Slack : sans changer un seul prompt, de meilleurs résultats que Sonnet 5 sur presque toutes ses évaluations, « en moins d'étapes et avec environ 14 % de tokens de sortie en moins », selon Curtis Allen, Principal Engineer.

Chez Epic Games, Daniel Vogel, directeur des opérations, va plus loin : Sonnet 5.5 « a franchi la même barre de qualité que celle qu'on attendrait d'un modèle de gamme supérieure » sur un audit de conception système.

Ce que ça change pour votre entreprise

La règle devient simple : Sonnet 5.5 par défaut, Opus 5.5 pour les exceptions.

  • Sonnet 5.5 pour le volume : corrections de bugs cadrées, revues de code, documents, slides, tableurs, réponses de support. Partout où le délai et le coût par tâche comptent.
  • Opus 5.5 pour ce qui engage : décisions d'architecture, migrations floues, problèmes ouverts qui demandent un jugement soutenu.

Le réglage d'effort, de Low à Max, devient votre vrai levier de coût. Par défaut, il est sur Medium dans Claude Code et les applications, et sur High dans la Claude Platform. Pour une mise en forme répétitive, restez bas. Pour une analyse où la cohérence des données compte, montez. Un point pour vos équipes techniques : si vous utilisiez Sonnet sans réflexion préalable (« thinking » désactivé), il faut passer au nouveau réglage between_tools avant de migrer.

Flux de déploiement de Sonnet 5.5 dans une PME, du choix du canal à la validation humaine avec réglage d'effort et contrôle des données.

Côté sécurité, Sonnet 5.5 est le premier Sonnet livré avec des protections cyber du niveau des modèles de frontière, et avec des classifieurs qui bloquent l'extraction de son raisonnement. La rétention zéro des données ne dispense pas pour autant de gouverner les accès, les secrets et les données sensibles : c'est le rôle de vos environnements cloud et DevOps.

Reste la seule question qui compte : combien vous coûte une tâche livrée, chez vous ? Un audit et cadrage sur quelques tâches de code, de documents et de support suffit pour le mesurer. L'automatisation et l'IA prennent ensuite le relais sur ce qui passe le test, avec notre méthode : partir de la tâche, jamais du modèle.

Sur le papier, Opus reste le plus fort. Sur la facture, Sonnet vient de passer devant.

Sources

Pour aller plus loin


Plus d'articles sur IA Générative & Agents

Décryptages, retours de terrain et modes d'emploi : ce que l'équipe apprend en livrant des projets, remis au propre.

OpenAI casse ses prix : GPT-6.1 Sol égale Astra en code pour 5 fois moins cher
IA Générative & Agents30 septembre 20266 min

OpenAI casse ses prix : GPT-6.1 Sol égale Astra en code pour 5 fois moins cher

Présenté au DevDay du 29 septembre 2026, GPT-6.1 Sol coûte cinq fois moins cher qu'Astra au token et l'égale sur un banc d'essai de code. Prix, disponibilité et impact sur le choix de modèle.

Eliott Bidault-HervouetEliott Bidault-Hervouet
Mistral héberge GLM de Z.ai : l'inférence en Europe, pas le modèle
IA Générative & Agents30 septembre 202610 min

Mistral héberge GLM de Z.ai : l'inférence en Europe, pas le modèle

Depuis août 2026, Mistral sert GLM-5.2 puis GLM-5.3, les modèles open weights de l'entreprise chinoise Z.ai, avec un endpoint européen. Ce que ça change pour les équipes, ce que ça apporte sur la localisation des données, et ce que ça laisse de côté sur la maîtrise du modèle.

Thomas DubreuilThomas Dubreuil
Dots OpenAI travaille 24h/24, mais pas pour tous
IA Générative & Agents30 septembre 20269 min

Dots OpenAI travaille 24h/24, mais pas pour tous

Dots OpenAI promet un agent IA actif 24h/24. Découvrez ses fonctions, son prix, ses limites et ce qu'une PME française peut réellement tester dès maintenant.

Evan PluchartEvan Pluchart

Combien coûterait votre projet ? Estimation gratuite

Décrivez votre besoin, nous revenons vers vous sous 24h avec une fourchette de budget et de délai.

Réponse sous 24h, sans engagement.

Alexandre Da Silva, Koul, à son poste de travail
Questions fréquentes

Le blog Koul

Ligne éditoriale, sources, usage : ce qui sort sur ce blog et comment vous pouvez vous en servir.

Votre question est plus complexe ?

Un échange court suffit souvent à trancher. Prenez un créneau, on vous répond sur votre cas.

Réserver un créneau