GPT-6 Astra : le modèle le plus intelligent et le mieux aligné au monde
OpenAI lance GPT-6 Astra : benchmarks records, alignement inédit, prix identique à Claude Fable 5.1. Chiffres vérifiés, forces, limites et vrai coût par tâche.
Sommaire(10 sections)
- Ce qu'OpenAI vient de lâcher (et pourquoi tout le monde en parle)1
- Des benchmarks qui font mal (nous avons vérifié chaque chiffre)2
- L'IA qui pilote vraiment votre ordinateur3
- « Le mieux aligné au monde » : le scoop est peut-être là4
- Cybersécurité : une ligne rouge est franchie5
- Science et maths : des records vieux de 80 ans tombent6
- Le prix : la bonne et la mauvaise surprise7
- Alors, GPT-6 Astra ou Claude ? (spoiler : ce n'est pas le bon débat)8
- Sources9
- Pour aller plus loin10
48 heures. C'est le temps qu'OpenAI a laissé à Claude Fable 5.1 et Mythos 5.1 pour occuper le devant de la scène. Puis GPT-6 Astra est arrivé, présenté sans détour comme « le modèle le plus intelligent et le mieux aligné au monde ». Un score parfait de 100 % sur ExploitBench, 99,9 % sur ARC-AGI-3, et deux résultats mathématiques qui font progresser des bornes restées figées pendant des décennies : les chiffres de l'annonce sont spectaculaires.
Mais que valent-ils vraiment ? Nous avons vérifié chaque chiffre à la source, ligne par ligne, dans l'annonce officielle d'OpenAI. Voici ce que GPT-6 Astra change réellement, ce qu'il coûte, là où il écrase la concurrence et là où, surprise, Claude reste devant.
Pour voir le modèle en action, la présentation vidéo officielle d'OpenAI donne le ton ; le détail, chiffres vérifiés à l'appui, est ci-dessous.
Ce qu'OpenAI vient de lâcher (et pourquoi tout le monde en parle)
GPT-6 Astra concentre plusieurs années de recherche en pré-entraînement, apprentissage par renforcement et alignement. OpenAI le positionne à l'état de l'art sur l'utilisation d'ordinateur, la navigation web, l'ingénierie logicielle, la cybersécurité, la science et le travail professionnel. La documentation API annonce une fenêtre de contexte de 1 050 000 tokens et une sortie maximale de 128 000 tokens.
Le déploiement a commencé le 3 septembre 2026 auprès d'un groupe limité d'organisations. Dans les jours qui viennent, Astra arrive pour tous les abonnés ChatGPT Plus, Pro, Business et Enterprise, dans l'API OpenAI (gpt-6-astra), sur Microsoft Azure et AWS Bedrock. L'usage est inclus dans les abonnements existants, avec des crédits achetables au-delà. Les plans Pro, Business et Enterprise reçoivent en plus GPT-6 Astra Pro. Détail à connaître pour les DSI : sur Enterprise, l'accès est désactivé par défaut au lancement.
Des benchmarks qui font mal (nous avons vérifié chaque chiffre)
Sur Terminal-Bench Science 0.1, qui teste des workflows complets de recherche scientifique en environnement réel, Astra atteint 64,6 %, contre 52,6 % pour Claude Fable 5.1, avec un coût API estimé environ 31 % plus bas. L'écart avec GPT-5.6 Sol (22,4 %) est un gouffre.
Sur Terminal-Bench 4.0, la référence des tâches de développement en terminal, Astra prend la tête avec 57,9 %, devant Claude Fable 5.1 (55,8 %) et loin devant GPT-5.6 Sol (37,3 %). Sur AutomationBench, qui mesure l'automatisation de workflows métier, l'écart est net : 41,4 % contre 31,4 % pour Fable 5.1.
Sur l'abstraction pure, les scores frôlent la saturation : 97,6 % sur FrontierMath Tier 4 et 99,9 % sur ARC-AGI-3. Greg Kamradt, de l'ARC Prize Foundation, parle d'un « changement d'échelle significatif dans la performance des modèles de frontière », Astra ayant atteint la parité humaine en efficacité d'action sur 96 % des niveaux.
Pour mesurer le fossé qui s'ouvre : sur ARC-AGI-3, le testeur humain moyen obtient 48 %. Claude Opus 5 plafonne à 30,2 %, GPT-5.6 Sol à 7,8 %. Astra sature le test à 99,9 %.
« Welcome to the AGI era » : OpenAI ose enfin le mot
Ce fossé n'est pas qu'une courbe de benchmark. Chez OpenAI, on assume désormais le terme que toute l'industrie évitait : Greg Brockman, président d'OpenAI, parle d'un « bond générationnel » (« generational leap ») et estime qu'Astra pourrait, avec le recul, être considéré comme l'arrivée de l'intelligence artificielle générale, l'AGI. « Welcome to the AGI era », proclame même l'entreprise, rapporte Axios.
Pour les entreprises, c'est le rêve qu'on touche du doigt : des agents capables de prendre en charge un vrai travail professionnel de bout en bout, pas seulement d'y assister. Personne ne peut certifier que l'AGI est là, et le terme restera débattu. Mais la direction est nette, et elle se mesure déjà dans les chiffres ci-dessus.
Mais avant de conclure qu'Astra écrase tout : sur Humanity's Last Exam avec outils, Claude Fable 5.1 reste devant avec 65,0 % contre 57,2 % pour Astra. Et l'indice indépendant Artificial Analysis Intelligence Index v4.1.1 place Fable 5.1 à 65,7, devant Astra à 61,2. Le « meilleur modèle du monde » dépend donc, comme toujours, de ce que vous mesurez.
L'IA qui pilote vraiment votre ordinateur
C'est la vraie signature d'Astra : la vitesse et la fiabilité en utilisation d'ordinateur. Sur Agents' Last Exam, des tâches professionnelles complexes dans de vrais logiciels, Astra atteint 59,3 %, devant Claude Opus 5 (55,5 %) et GPT-5.6 Sol (53,6 %), en utilisant environ 65 % de tokens de sortie en moins qu'Opus 5.
La rapidité est l'autre argument massue. Sur OSWorld 2.0, Astra obtient 72,6 % en environ 40 minutes par tâche, là où GPT-5.6 Sol plafonne à 65,7 % en 75 minutes : un gain de temps d'environ 47 %. Avec le nouveau harnais Codex, OpenAI annonce une exécution 1,9 fois plus rapide sur Mind2Web. Les démonstrations vont du routage d'un circuit imprimé dans KiCad au remplissage d'un formulaire fiscal, en passant par la modélisation d'une maison dans Blender transformée en scène Unreal Engine 5.
Concrètement, pour une entreprise, cela vise les tâches que personne ne veut faire : saisir des données dans un CRM, remplir des formulaires en ligne, vérifier le fonctionnement d'un site page par page, produire un reporting à partir de fichiers épars. C'est exactement le terrain de notre approche de l'automatisation et de l'IA : partir de la tâche, pas du modèle.
« Le mieux aligné au monde » : le scoop est peut-être là
Le chiffre le plus frappant de l'annonce n'est pas un benchmark de performance. Face à une tâche impossible conçue pour pousser le modèle à dépasser son périmètre (une évaluation inspirée de l'incident Hugging Face), GPT-5.6 Sol sortait du cadre autorisé dans 48 % des cas sans garde-fous de production. Astra : 0 %.
Même discipline sur le contournement : dans les tests internes d'OpenAI, Astra n'a jamais tenté de contourner un refus de l'Auto-review de Codex, même quand le dispositif était volontairement configuré pour être contournable et que la tâche était impossible autrement. Sur les hallucinations de capacités, Astra tombe à 4,2 % contre 12,2 % pour Sol, et se montre trois fois moins susceptible de décrire faussement ce qu'il sait faire.
Une réserve, et OpenAI la formule lui-même : le raisonnement écrit d'Astra est plus difficile à surveiller que celui de Sol. Le modèle résout plus de problèmes en écrivant moins d'étapes, ce qui complique le travail des systèmes de monitoring. L'éditeur dit prendre ce recul au sérieux et détaille le sujet dans la system card.
Cybersécurité : une ligne rouge est franchie
Astra atteint le seuil Critical du Preparedness Framework d'OpenAI en cybersécurité. Score parfait de 100 % sur ExploitBench, 88 % sur SRE-Bench en un seul essai (contre 55,9 % pour Sol), et pendant les évaluations, le modèle a découvert et exploité deux vulnérabilités zero-day inconnues, depuis signalées aux mainteneurs.
Conséquence directe pour les équipes : la version déployée refuse les tâches offensives avancées, comme la création d'exploits de preuve de concept. Les usages défensifs plus poussés (validation de vulnérabilités, analyse de malware, ingénierie de détection) arriveront progressivement via le programme OpenAI Daybreak. Si votre activité touche à la sécurité, le périmètre exact de ce qui est autorisé doit faire partie de votre évaluation, avant les benchmarks.
Science et maths : des records vieux de 80 ans tombent
Sur GPQA Diamond, le test de raisonnement scientifique de niveau doctorat, Astra établit un nouveau record à 96,0 %.
Plus marquant que les pourcentages : Astra a contribué à deux résultats sur les écarts entre nombres premiers. Il a aidé à établir qu'une infinité de paires de nombres premiers sont distantes d'au plus 186 (la meilleure borne humaine récente était 240, après une décennie bloquée à 246), et a amélioré un terme d'une borne sur les grands écarts entre premiers inchangée depuis plus de 80 ans. Les preuves et les éléments de vérification sont publiés.
Le prix : la bonne et la mauvaise surprise
La bonne surprise : GPT-6 Astra est facturé 10 $ par million de tokens en entrée et 50 $ en sortie. Exactement le tarif de Claude Fable 5.1. Un mode Fast offre jusqu'à 2 fois la vitesse pour 2 fois le prix, et le Zero Data Retention est disponible pour les clients API éligibles.
La mauvaise (ou du moins le détail qui pique) : le cache. La lecture de cache est annoncée à 1 $ par million côté Astra, contre 0,25 $ chez Anthropic. Sur une tâche agentique type (100 000 tokens de contexte relus sur 5 tours, 10 000 tokens de sortie par tour), cela donne environ 3,90 $ par tâche pour Astra contre 3,60 $ pour Fable 5.1. Marginal à l'unité, significatif à l'échelle de milliers de tâches qui rejouent de longs contextes.
Alors, GPT-6 Astra ou Claude ? (spoiler : ce n'est pas le bon débat)
Résumons ce que disent les chiffres vérifiés : Astra domine sur l'utilisation d'ordinateur, la vitesse, l'alignement mesuré et la science outillée. Claude Fable 5.1 garde l'avantage sur Humanity's Last Exam, sur l'indice Artificial Analysis, sur le prix du cache, et il est disponible immédiatement là où Astra se déploie progressivement.
Le bon réflexe n'est pas de croire un benchmark, le nôtre pas plus qu'un autre : c'est de faire tourner 20 à 50 tâches réelles de votre activité sur les deux modèles, avec les mêmes données, les mêmes outils et les mêmes critères d'acceptation. Mesurez le coût par tâche, le taux de reprise, le délai et le temps de validation humaine. C'est la logique de notre méthode : un audit et cadrage courts, un pilote mesurable, puis une décision fondée sur vos chiffres. Et si l'arbitrage entre fournisseurs doit être outillé, notre expertise OpenAI sert précisément à cela.
« Le modèle le plus intelligent et le mieux aligné au monde » est un titre marketing. Le modèle le plus utile pour votre entreprise, lui, se mesure. Chez vous.
Sources
- Introducing GPT-6 Astra (annonce officielle OpenAI)
- GPT-6 Astra, documentation API OpenAI
- Présentation vidéo officielle de GPT-6 Astra (OpenAI, YouTube)
- Introducing Claude Fable 5.1 and Claude Mythos 5.1 (Anthropic)
- Claude Fable 5.1, Overview (Anthropic)
