Aller au contenu principal
IA Générative & Agents

Claude Haiku 5.5 face à GPT-6 Luna et Sonnet 5.5 : le petit modèle d'Anthropic change-t-il la donne pour l'IA à grande échelle ?

Claude Haiku 5.5 reduit le cout des taches IA repetitives. Comparez ses prix, ses benchmarks, GPT-6 Luna et Sonnet 5.5 pour choisir selon votre usage.

Evan PluchartEvan PluchartPublié le 8 octobre 20268 min
Résumer cet article avec une IA

90 % moins cher que Haiku 4.5 sous 100 000 tokens. C'est la promesse affichée pour Claude Haiku 5.5, lancé par Anthropic le 7 octobre 2026. Le modèle coûte 0,10 $ en entrée et 0,50 $ en sortie par million de tokens sur ce palier, rejoint GPT-6 Luna sur le tarif de base et fait un bond spectaculaire face à Haiku 4.5.

Mais une facture d'IA ne dépend pas d'un tarif isolé. Un token est une petite unité de texte, comptée à l'entrée et à la sortie. La longueur du document, l'effort demandé et les reprises comptent aussi. Nous avons vérifié chaque chiffre à sa source : Haiku 5.5 est une option forte pour les tâches courtes et répétitives, mais Luna garde un avantage sur les très longs contextes et Sonnet 5.5 reste devant pour le code agentique complexe.

Le prix est divisé par dix, mais seulement dans la zone la plus fréquente

Anthropic annonce pour Haiku 5.5 un prix de 0,10 $ / 0,50 $ par million de tokens, en entrée et en sortie, pour les prompts allant jusqu'à 100 000 tokens. Au-delà, le tarif passe à 0,50 $ / 2,50 $. Le premier palier est présenté comme 90 % moins cher que Haiku 4.5, le second comme 50 % moins cher.

Tableau officiel des prix par million de tokens pour Haiku 5.5, Haiku 4.5 et Sonnet 5.5. Source : Anthropic

En moyenne, Anthropic annonce un modèle qui coûte environ 75 % de moins à faire tourner que Haiku 4.5. Autrement dit, pas une baisse uniforme de 90 % sur chaque facture.

Le détail qui change le calcul vient du tokenizer. C'est le composant qui découpe un texte en tokens. Selon le guide de migration, un même texte produit environ 30 % de tokens en plus sur Haiku 5.5 que sur Haiku 4.5. Simon Willison a mesuré environ 1,25 fois plus de tokens sur un long prompt et parle d'une « hausse de prix cachée ».

Le modèle porte l'identifiant claude-haiku-5-5 et est disponible sur Claude Platform, Amazon Web Services, Google Cloud et Microsoft Azure. La migration n'est pas qu'un changement de nom : le guide impose le mode de réflexion adaptive, le paramètre output_config.effort et la suppression de temperature, top_p et top_k. Sur un projet en production, ce genre de mise à jour relève de la maintenance.

Haiku 5.5 ou GPT-6 Luna : égalité au départ, avantage à Luna quand le contexte s'allonge

Sur une requête courte, Haiku 5.5 et GPT-6 Luna affichent le même tarif de base : 0,10 $ en entrée et 0,50 $ en sortie par million de tokens. Cela couvre un résumé de courriel, une classification, une extraction de facture ou une réponse de support.

Le long document redistribue les cartes. Haiku 5.5 change de palier au-delà de 100 000 tokens. GPT-6 Luna conserve son tarif de base jusqu'à 272 000 tokens d'entrée. Au-delà, sa documentation indique un prix multiplié par deux pour l'entrée et le cache, et par 1,5 pour la sortie, sur toute la requête.

Concrètement : entre 100 000 et 272 000 tokens, Haiku 5.5 facture 0,50 $ / 2,50 $ quand Luna reste à 0,10 $ / 0,50 $. Au-delà de 272 000 tokens, Luna monte à 0,20 $ / 0,75 $, toujours nettement sous Haiku. Et le tokenizer plus gourmand de Haiku creuse encore l'écart.

Les scores donnent envie de migrer, jusqu'à ce que Sonnet 5.5 entre dans le tableau

Les benchmarks sont des tests standardisés. GDPval-AA mesure des travaux professionnels simulés, OSWorld les actions sur ordinateur, Terminal-Bench les tâches complexes en ligne de commande et FrontierCode la programmation.

Le tableau ci-dessous rassemble les résultats publiés par Anthropic. Ce sont des résultats vendor-reported, donc déclarés par le fournisseur. Ils donnent une direction, mais ne constituent pas encore une vérification indépendante complète.

Test et ce qu'il mesure Claude Haiku 5.5 GPT-6 Luna Claude Sonnet 5.5
GDPval-AA v2.1, travail professionnel 1 620 1 437 1 840
OSWorld 2.1 offline, actions sur ordinateur 72,4 % 48,9 % 83,9 %
Terminal-Bench 4.0, code agentique 39,2 % 16,4 % 70,6 %
FrontierCode 1.1 Main, programmation 46,4 % 42,4 % 52,1 %

Tableau officiel des performances de Haiku 5.5, Haiku 4.5, GPT-6 Luna et Sonnet 5.5. Source : Anthropic

Le bond face à Haiku 4.5 reste impressionnant : OSWorld passe de 15,7 % à 72,4 %, tandis que Terminal-Bench passe de 0 % à 39,2 %. Haiku 5.5 devient plus crédible pour agir et utiliser des outils.

Mais la conclusion doit rester précise. Dans les quatre lignes retenues, Haiku 5.5 est devant Luna, mais derrière Sonnet 5.5. Le tableau complet d'Anthropic confirme ce classement sur AA-Briefcase (1 578 contre 1 336 pour Luna et 1 824 pour Sonnet) et sur Chartography (46,4 % contre 29,1 % et 61,6 %). Sur Humanity's Last Exam, aucun score n'est publié pour Luna.

Attention aussi aux réglages : les scores OSWorld et Terminal-Bench de Haiku 5.5 sont obtenus à l'effort maximal, et celui de Sonnet sur FrontierCode en effort Xhigh. Le modèle n'est pas universel. Le tableau montre surtout qu'un petit modèle peut désormais prendre en charge une partie du travail qui exigeait auparavant un modèle plus cher.

Le réglage d'effort est la vraie surprise : un même modèle, plusieurs compromis

Haiku 5.5 est le premier Haiku à proposer un réglage d'effort, sur cinq niveaux : low, medium, high, xhigh et max. Le niveau medium est celui par défaut sur l'API. Vous pouvez demander moins de réflexion pour un tri rapide, ou davantage pour une tâche qui demande plusieurs étapes.

Cette option change la lecture des scores. Le 39,2 % affiché sur Terminal-Bench correspond à l'effort maximal dans le graphique d'Anthropic : au niveau medium, le même graphique place Haiku 5.5 autour de 20 %. Même chose sur OSWorld : 72,4 % en max, un peu plus de 50 % en medium. Associez donc chaque score à son effort, sa latence et sa consommation de tokens.

Graphique officiel Terminal-Bench 4.0 : score de Haiku 5.5 selon le niveau d'effort, comparé à Haiku 4.5 et Sonnet 5.5. Source : Anthropic

Sonnet 5.5 garde sa place pour le code agentique complexe. Son tarif est de 2 $ / 10 $ par million de tokens, en entrée et en sortie. Anthropic a aussi divisé par deux le prix de ses lectures en cache (cache reads), de 0,20 $ à 0,10 $ par million de tokens, ce qui représente environ 20 % de baisse sur la plupart des tâches agentiques selon l'éditeur.

Une architecture simple consiste à confier le pilotage d'une mission complexe à Sonnet 5.5, puis à utiliser Haiku 5.5 pour résumer, classer ou récupérer une donnée précise. Chez Koul, notre équipe privilégie ce découpage quand il réduit le coût. Vous pouvez approfondir cette logique avec notre méthode.

Cette répartition rejoint aussi les usages d'automatisation et d'IA, lorsque plusieurs étapes doivent s'enchaîner.

Les premiers retours sont prometteurs, pas suffisants pour croire sur parole

Anthropic rapporte plusieurs évaluations clientes. Chez HubSpot, Ze'ev Klapow, Distinguished Software Engineer, parle du « meilleur score jamais vu » sur leur suite : 92,8 %, en moyenne sur trois exécutions. Box rapporte 11 points de mieux que Haiku 4.5, avec environ la moitié de la latence. Asana mesure plus de 30 % de latence en moins et une inférence jusqu'à 2,5 fois plus rapide par tour d'agent.

Ces résultats ne sont pas directement comparables. Chaque entreprise utilise ses données, son protocole et son modèle de départ. Ce sont des témoignages choisis par l'éditeur pour son annonce : aucun ne vaut victoire générale.

Pour vérifier le résultat, choisissez trois tâches réelles : résumés, classification et extraction. Gardez les mêmes prompts et le même volume. Mesurez le coût par réponse réussie, le délai, les erreurs et les reprises, avec Haiku 5.5 en medium puis avec un effort supérieur.

Un audit peut formaliser ce test, mais la logique reste simple : comparer les modèles sur votre travail quotidien, pas sur leur nom.

Alors, Haiku 5.5 change-t-il la donne ?

Oui, pour les tâches courtes, nombreuses et bien cadrées. Le prix sous 100 000 tokens et le bond face à Haiku 4.5 rendent les résumés, classifications, requêtes de base de données et réponses de support plus accessibles. Haiku 5.5 peut aussi servir de sous-agent à Sonnet 5.5 ou Opus 5.5.

Non, si vous cherchez un modèle unique. Luna devient plus intéressant sur les très longs contextes. Sonnet 5.5 conserve l'avantage sur le code agentique complexe. Et les chiffres disponibles restent principalement déclarés par Anthropic.

Le bon choix se mesure au coût par tâche réussie, avec vos consignes, vos volumes et vos exigences de délai. Le modèle le plus utile n'est pas celui qui gagne le tableau. C'est celui qui réussit votre travail au juste coût.

Schéma de routage : Haiku 5.5 pour les tâches courtes et nombreuses, GPT-6 Luna pour les très longs contextes, et Sonnet 5.5 pour le code agentique complexe.

Sources

Pour aller plus loin


Plus d'articles sur IA Générative & Agents

Décryptages, retours de terrain et modes d'emploi : ce que l'équipe apprend en livrant des projets, remis au propre.

1,7 milliard pour Mistral AI : ce que cela change vraiment
IA Générative & Agents9 octobre 202611 min

1,7 milliard pour Mistral AI : ce que cela change vraiment

Mistral AI lève 1,7 milliard d'euros. Comprenez ce que cette puissance change pour une PME : données, coûts, hébergement et déploiement de cas d'usage.

Evan PluchartEvan Pluchart
Cloudflare lance cf : toute son API en ligne de commande, pensée pour les agents
IA Générative & Agents7 octobre 20269 min

Cloudflare lance cf : toute son API en ligne de commande, pensée pour les agents

Cloudflare publie en bêta cf, une CLI unique qui couvre plus de 2 900 commandes de son API et vise d'abord les agents de code. Ce qui sort, ce qui change pour les projets Wrangler, et les garde-fous à poser avant de laisser un agent piloter votre compte.

Thomas DubreuilThomas Dubreuil
Mistral Large 4 "Le Chonk" : faut-il tester ce modèle ouvert pour reprendre le contrôle de son IA d'entreprise ?
IA Générative & Agents7 octobre 202612 min

Mistral Large 4 "Le Chonk" : faut-il tester ce modèle ouvert pour reprendre le contrôle de son IA d'entreprise ?

Mistral Large 4 est testable par API. Découvrez une méthode de pilote pour mesurer qualité, coûts, sécurité et réversibilité avant tout déploiement interne.

Evan PluchartEvan Pluchart

Combien coûterait votre projet ? Estimation gratuite

Décrivez votre besoin, nous revenons vers vous sous 24h avec une fourchette de budget et de délai.

Réponse sous 24h, sans engagement.

Alexandre Da Silva, Koul, à son poste de travail
Questions fréquentes

Le blog Koul

Ligne éditoriale, sources, usage : ce qui sort sur ce blog et comment vous pouvez vous en servir.

Votre question est plus complexe ?

Un échange court suffit souvent à trancher. Prenez un créneau, on vous répond sur votre cas.

Réserver un créneau