Aller au contenu principal
IA Générative & Agents

GPT-6 Astra : le modèle le plus intelligent et le mieux aligné au monde

OpenAI lance GPT-6 Astra : benchmarks records, alignement inédit, prix identique à Claude Fable 5.1. Chiffres vérifiés, forces, limites et vrai coût par tâche.

Evan PluchartEvan PluchartPublié le 4 septembre 20268 min
Résumer cet article avec une IA

48 heures. C'est le temps qu'OpenAI a laissé à Claude Fable 5.1 et Mythos 5.1 pour occuper le devant de la scène. Puis GPT-6 Astra est arrivé, présenté sans détour comme « le modèle le plus intelligent et le mieux aligné au monde ». Un score parfait de 100 % sur ExploitBench, 99,9 % sur ARC-AGI-3, et deux résultats mathématiques qui font progresser des bornes restées figées pendant des décennies : les chiffres de l'annonce sont spectaculaires.

Mais que valent-ils vraiment ? Nous avons vérifié chaque chiffre à la source, ligne par ligne, dans l'annonce officielle d'OpenAI. Voici ce que GPT-6 Astra change réellement, ce qu'il coûte, là où il écrase la concurrence et là où, surprise, Claude reste devant.

Pour voir le modèle en action, la présentation vidéo officielle d'OpenAI donne le ton ; le détail, chiffres vérifiés à l'appui, est ci-dessous.

Ce qu'OpenAI vient de lâcher (et pourquoi tout le monde en parle)

GPT-6 Astra concentre plusieurs années de recherche en pré-entraînement, apprentissage par renforcement et alignement. OpenAI le positionne à l'état de l'art sur l'utilisation d'ordinateur, la navigation web, l'ingénierie logicielle, la cybersécurité, la science et le travail professionnel. La documentation API annonce une fenêtre de contexte de 1 050 000 tokens et une sortie maximale de 128 000 tokens.

Le déploiement a commencé le 3 septembre 2026 auprès d'un groupe limité d'organisations. Dans les jours qui viennent, Astra arrive pour tous les abonnés ChatGPT Plus, Pro, Business et Enterprise, dans l'API OpenAI (gpt-6-astra), sur Microsoft Azure et AWS Bedrock. L'usage est inclus dans les abonnements existants, avec des crédits achetables au-delà. Les plans Pro, Business et Enterprise reçoivent en plus GPT-6 Astra Pro. Détail à connaître pour les DSI : sur Enterprise, l'accès est désactivé par défaut au lancement.

Des benchmarks qui font mal (nous avons vérifié chaque chiffre)

Sur Terminal-Bench Science 0.1, qui teste des workflows complets de recherche scientifique en environnement réel, Astra atteint 64,6 %, contre 52,6 % pour Claude Fable 5.1, avec un coût API estimé environ 31 % plus bas. L'écart avec GPT-5.6 Sol (22,4 %) est un gouffre.

Graphique OpenAI du benchmark Terminal-Bench Science 0.1 : GPT-6 Astra atteint 64,6 % de taux de résolution, devant Claude Fable 5.1 à 52,6 %, à coût API inférieur

Sur Terminal-Bench 4.0, la référence des tâches de développement en terminal, Astra prend la tête avec 57,9 %, devant Claude Fable 5.1 (55,8 %) et loin devant GPT-5.6 Sol (37,3 %). Sur AutomationBench, qui mesure l'automatisation de workflows métier, l'écart est net : 41,4 % contre 31,4 % pour Fable 5.1.

Graphique OpenAI du benchmark Terminal-Bench 4.0 : GPT-6 Astra à 57,9 % devant Claude Fable 5.1 à 55,8 % et GPT-5.6 Sol à 37,3 %

Sur l'abstraction pure, les scores frôlent la saturation : 97,6 % sur FrontierMath Tier 4 et 99,9 % sur ARC-AGI-3. Greg Kamradt, de l'ARC Prize Foundation, parle d'un « changement d'échelle significatif dans la performance des modèles de frontière », Astra ayant atteint la parité humaine en efficacité d'action sur 96 % des niveaux.

Pour mesurer le fossé qui s'ouvre : sur ARC-AGI-3, le testeur humain moyen obtient 48 %. Claude Opus 5 plafonne à 30,2 %, GPT-5.6 Sol à 7,8 %. Astra sature le test à 99,9 %.

Graphique OpenAI du benchmark ARC-AGI-3 : GPT-6 Astra sature le test à 99,9 %, loin devant Claude Opus 5 à 30,2 % et GPT-5.6 Sol à 7,8 %, quand le testeur humain moyen obtient 48 %

« Welcome to the AGI era » : OpenAI ose enfin le mot

Ce fossé n'est pas qu'une courbe de benchmark. Chez OpenAI, on assume désormais le terme que toute l'industrie évitait : Greg Brockman, président d'OpenAI, parle d'un « bond générationnel » (« generational leap ») et estime qu'Astra pourrait, avec le recul, être considéré comme l'arrivée de l'intelligence artificielle générale, l'AGI. « Welcome to the AGI era », proclame même l'entreprise, rapporte Axios.

Pour les entreprises, c'est le rêve qu'on touche du doigt : des agents capables de prendre en charge un vrai travail professionnel de bout en bout, pas seulement d'y assister. Personne ne peut certifier que l'AGI est là, et le terme restera débattu. Mais la direction est nette, et elle se mesure déjà dans les chiffres ci-dessus.

Mais avant de conclure qu'Astra écrase tout : sur Humanity's Last Exam avec outils, Claude Fable 5.1 reste devant avec 65,0 % contre 57,2 % pour Astra. Et l'indice indépendant Artificial Analysis Intelligence Index v4.1.1 place Fable 5.1 à 65,7, devant Astra à 61,2. Le « meilleur modèle du monde » dépend donc, comme toujours, de ce que vous mesurez.

L'IA qui pilote vraiment votre ordinateur

C'est la vraie signature d'Astra : la vitesse et la fiabilité en utilisation d'ordinateur. Sur Agents' Last Exam, des tâches professionnelles complexes dans de vrais logiciels, Astra atteint 59,3 %, devant Claude Opus 5 (55,5 %) et GPT-5.6 Sol (53,6 %), en utilisant environ 65 % de tokens de sortie en moins qu'Opus 5.

Graphique OpenAI du benchmark Agents' Last Exam : GPT-6 Astra à 59,3 % devant Claude Opus 5 à 55,5 % et GPT-5.6 Sol à 53,6 %

La rapidité est l'autre argument massue. Sur OSWorld 2.0, Astra obtient 72,6 % en environ 40 minutes par tâche, là où GPT-5.6 Sol plafonne à 65,7 % en 75 minutes : un gain de temps d'environ 47 %. Avec le nouveau harnais Codex, OpenAI annonce une exécution 1,9 fois plus rapide sur Mind2Web. Les démonstrations vont du routage d'un circuit imprimé dans KiCad au remplissage d'un formulaire fiscal, en passant par la modélisation d'une maison dans Blender transformée en scène Unreal Engine 5.

Concrètement, pour une entreprise, cela vise les tâches que personne ne veut faire : saisir des données dans un CRM, remplir des formulaires en ligne, vérifier le fonctionnement d'un site page par page, produire un reporting à partir de fichiers épars. C'est exactement le terrain de notre approche de l'automatisation et de l'IA : partir de la tâche, pas du modèle.

Flux de travail GPT-6 Astra reliant recherche, fichiers, code, navigation et document final, avec 1 050 000 tokens de contexte et 128 000 tokens de sortie maximale

« Le mieux aligné au monde » : le scoop est peut-être là

Le chiffre le plus frappant de l'annonce n'est pas un benchmark de performance. Face à une tâche impossible conçue pour pousser le modèle à dépasser son périmètre (une évaluation inspirée de l'incident Hugging Face), GPT-5.6 Sol sortait du cadre autorisé dans 48 % des cas sans garde-fous de production. Astra : 0 %.

Même discipline sur le contournement : dans les tests internes d'OpenAI, Astra n'a jamais tenté de contourner un refus de l'Auto-review de Codex, même quand le dispositif était volontairement configuré pour être contournable et que la tâche était impossible autrement. Sur les hallucinations de capacités, Astra tombe à 4,2 % contre 12,2 % pour Sol, et se montre trois fois moins susceptible de décrire faussement ce qu'il sait faire.

Une réserve, et OpenAI la formule lui-même : le raisonnement écrit d'Astra est plus difficile à surveiller que celui de Sol. Le modèle résout plus de problèmes en écrivant moins d'étapes, ce qui complique le travail des systèmes de monitoring. L'éditeur dit prendre ce recul au sérieux et détaille le sujet dans la system card.

Cybersécurité : une ligne rouge est franchie

Astra atteint le seuil Critical du Preparedness Framework d'OpenAI en cybersécurité. Score parfait de 100 % sur ExploitBench, 88 % sur SRE-Bench en un seul essai (contre 55,9 % pour Sol), et pendant les évaluations, le modèle a découvert et exploité deux vulnérabilités zero-day inconnues, depuis signalées aux mainteneurs.

Conséquence directe pour les équipes : la version déployée refuse les tâches offensives avancées, comme la création d'exploits de preuve de concept. Les usages défensifs plus poussés (validation de vulnérabilités, analyse de malware, ingénierie de détection) arriveront progressivement via le programme OpenAI Daybreak. Si votre activité touche à la sécurité, le périmètre exact de ce qui est autorisé doit faire partie de votre évaluation, avant les benchmarks.

Science et maths : des records vieux de 80 ans tombent

Sur GPQA Diamond, le test de raisonnement scientifique de niveau doctorat, Astra établit un nouveau record à 96,0 %.

Graphique OpenAI du benchmark GPQA Diamond : GPT-6 Astra établit un record à 96,0 % de précision en raisonnement scientifique de niveau doctorat

Plus marquant que les pourcentages : Astra a contribué à deux résultats sur les écarts entre nombres premiers. Il a aidé à établir qu'une infinité de paires de nombres premiers sont distantes d'au plus 186 (la meilleure borne humaine récente était 240, après une décennie bloquée à 246), et a amélioré un terme d'une borne sur les grands écarts entre premiers inchangée depuis plus de 80 ans. Les preuves et les éléments de vérification sont publiés.

Le prix : la bonne et la mauvaise surprise

La bonne surprise : GPT-6 Astra est facturé 10 $ par million de tokens en entrée et 50 $ en sortie. Exactement le tarif de Claude Fable 5.1. Un mode Fast offre jusqu'à 2 fois la vitesse pour 2 fois le prix, et le Zero Data Retention est disponible pour les clients API éligibles.

La mauvaise (ou du moins le détail qui pique) : le cache. La lecture de cache est annoncée à 1 $ par million côté Astra, contre 0,25 $ chez Anthropic. Sur une tâche agentique type (100 000 tokens de contexte relus sur 5 tours, 10 000 tokens de sortie par tour), cela donne environ 3,90 $ par tâche pour Astra contre 3,60 $ pour Fable 5.1. Marginal à l'unité, significatif à l'échelle de milliers de tâches qui rejouent de longs contextes.

Comparaison du coût estimé d'une tâche sur cinq tours : environ 3,90 $ pour GPT-6 Astra contre 3,60 $ pour Claude Fable 5.1 ou Mythos 5.1

Alors, GPT-6 Astra ou Claude ? (spoiler : ce n'est pas le bon débat)

Résumons ce que disent les chiffres vérifiés : Astra domine sur l'utilisation d'ordinateur, la vitesse, l'alignement mesuré et la science outillée. Claude Fable 5.1 garde l'avantage sur Humanity's Last Exam, sur l'indice Artificial Analysis, sur le prix du cache, et il est disponible immédiatement là où Astra se déploie progressivement.

Matrice de décision des modèles GPT-6 Astra, Claude Fable 5.1, Claude Mythos 5.1 et Claude Opus 5 selon l'accès et le niveau de risque

Le bon réflexe n'est pas de croire un benchmark, le nôtre pas plus qu'un autre : c'est de faire tourner 20 à 50 tâches réelles de votre activité sur les deux modèles, avec les mêmes données, les mêmes outils et les mêmes critères d'acceptation. Mesurez le coût par tâche, le taux de reprise, le délai et le temps de validation humaine. C'est la logique de notre méthode : un audit et cadrage courts, un pilote mesurable, puis une décision fondée sur vos chiffres. Et si l'arbitrage entre fournisseurs doit être outillé, notre expertise OpenAI sert précisément à cela.

« Le modèle le plus intelligent et le mieux aligné au monde » est un titre marketing. Le modèle le plus utile pour votre entreprise, lui, se mesure. Chez vous.

Sources

Pour aller plus loin


Plus d'articles sur IA Générative & Agents

Décryptages, retours de terrain et modes d'emploi : ce que l'équipe apprend en livrant des projets, remis au propre.

Fable 5.1 face à GPT-5.6 : le coût ne suffit pas à décider
IA Générative & Agents2 septembre 202613 min

Fable 5.1 face à GPT-5.6 : le coût ne suffit pas à décider

Comparez Claude Fable 5.1, Mythos 5.1, GPT-5.6 et DeepSeek. Choisissez selon vos tâches, votre budget et vos risques, puis lancez un test métier mesurable.

Evan PluchartEvan Pluchart
GLM-5.3 : Z.ai ouvre son modèle et abandonne la licence MIT
IA Générative & Agents1 septembre 20268 min

GLM-5.3 : Z.ai ouvre son modèle et abandonne la licence MIT

Z.ai a mis GLM-5.3 en téléchargement libre le 28 août 2026, après deux semaines de revue de sûreté liée à ses capacités cyber. Mais le modèle quitte la licence MIT pour une licence maison qui vise les géants du cloud.

Eliott Bidault-HervouetEliott Bidault-Hervouet
Qwen3.8-27B : le modèle ouvert d'Alibaba se mesure à Claude
IA Générative & Agents28 août 20269 min

Qwen3.8-27B : le modèle ouvert d'Alibaba se mesure à Claude

Alibaba a publié Qwen3.8-27B le 14 août 2026 sous licence Apache 2.0. Sur les benchmarks de l'éditeur, le modèle passe devant Claude Opus 4.6 sur deux épreuves de code et reste derrière sur d'autres. Nous faisons le point pour les équipes qui arbitrent entre API propriétaire et modèle auto-hébergé.

Eliott Bidault-HervouetEliott Bidault-Hervouet

Combien coûterait votre projet ? Estimation gratuite

Décrivez votre besoin, nous revenons vers vous sous 24h avec une fourchette de budget et de délai.

Réponse sous 24h, sans engagement.

Alexandre Da Silva, Koul, à son poste de travail
Questions fréquentes

Le blog Koul

Ligne éditoriale, sources, usage : ce qui sort sur ce blog et comment vous pouvez vous en servir.

Votre question est plus complexe ?

Un échange court suffit souvent à trancher. Prenez un créneau, on vous répond sur votre cas.

Réserver un créneau