Gemini 4 Argon : le score suffit-il pour choisir une IA ?
Gemini 4 Argon arrive en tête des benchmarks, mais son accès reste limité. Découvrez ses coûts, ses limites et la méthode pour le tester en entreprise.
Sommaire(7 sections)
- Google reprend la tête... mais qui peut encore essayer Argon ?1
- 13 premières places sur 18 : le verdict est impressionnant... et incomplet2
- Le test indépendant refroidit-il la couronne ? Un peu3
- « Benchmaxxing » : accusation sérieuse, preuve encore absente4
- Le verdict honnête : impossible de trancher avant le terrain5
- Pour aller plus loin6
- Sources7
13 catégories en tête. 1 million de tokens en sortie. 0 accès public général. Gemini 4 Argon arrive avec une promesse spectaculaire, mais les entreprises ne peuvent pas encore la vérifier librement.
Le problème est concret. Quand un fournisseur affiche le meilleur score, comment savoir si votre équipe gagnera réellement du temps ou réduira son coût ? Nous avons séparé les annonces de Google, les mesures indépendantes et les témoignages. Argon semble très compétitif, mais la question du travail réel reste ouverte.
Google reprend la tête... mais qui peut encore essayer Argon ?
Une annonce taillée pour les entreprises
Le 30 septembre 2026, Google DeepMind présente Gemini 4 Argon comme son nouveau modèle de pointe. Le modèle vise les workflows longs en ingénierie logicielle, en droit, en finance et en cybersécurité. Un workflow désigne ici une suite de tâches liées, avec des documents, des outils et des validations humaines.
L'accès initial reste limité aux « trusted cyber defenders » du Fairwind Program et à des testeurs précoces. Google annonce une ouverture progressive aux développeurs, aux entreprises et aux particuliers. Les premiers concernés seront les clients API payants et les abonnés Google AI Ultra. Une API est une interface qui permet à un logiciel d'utiliser le modèle sans passer par une application grand public.
Pour un décideur, cette restriction change la lecture de l'annonce. Il n'est pas encore possible de comparer plusieurs fournisseurs dans les mêmes conditions sur ses propres données.
Le prix choc a une date de péremption
Google annonce un tarif d'introduction de 2 dollars par million de tokens en entrée et 10 dollars en sortie. Un token est une unité de texte traitée par le modèle, souvent plus courte qu'un mot. L'entrée en cache bénéficie d'une remise de 95 %, lorsque le système réutilise un contexte déjà transmis.
La note officielle précise qu'après la période d'introduction, le tarif passera à 4 dollars en entrée et 20 dollars en sortie par million de tokens. C'est exactement le tarif de Claude Opus 5.5 relevé par Artificial Analysis. Cette échéance doit entrer dans tout calcul de budget. Le prix affiché au lancement ne doit pas devenir le coût de référence d'un projet qui durera plusieurs mois.
La limite de sortie passe aussi à 1 million de tokens, contre 64 000 auparavant. Cela peut aider à analyser une base de code volumineuse ou un audit documentaire. Cette capacité mesure la longueur possible d'une réponse, pas sa pertinence.
Voici le tableau publié par Google DeepMind. Il montre l'étendue des catégories couvertes, mais il ne remplace pas un test sur vos propres tâches.
13 premières places sur 18 : le verdict est impressionnant... et incomplet
Ce que Google met en avant
Dans le tableau publié au lancement, Argon obtient le meilleur score ou partage la première place dans 13 catégories sur 18, avec 12 victoires nettes et 1 égalité, selon le décompte du tableau officiel de Google DeepMind. GraphWalks, mesuré à deux longueurs de contexte, compte ici pour une seule catégorie.
DeepSWE v1.1 évalue des tâches longues d'ingénierie logicielle. Argon atteint 77,9 %, contre 74,2 % pour Claude Opus 5.5 et 74,1 % pour GPT-6 Astra. Le Harvey Legal Agent Benchmark teste des tâches juridiques assistées par agent, un système capable de chercher, raisonner et agir avec des outils : Argon atteint 19,6 %, contre 5,4 % pour Astra et 3,8 % pour Opus.
Google met également en avant 91,7 % sur LVBench, qui évalue la compréhension de vidéos longues, et 51,3 % sur AutomationBench, consacré aux tâches automatisées. Ces scores indiquent une couverture large, pas encore le retour sur investissement d'une équipe.
Le graphique montre une avance d'Argon sur ce test précis. Il ne dit pas combien de corrections humaines une entreprise devra effectuer ensuite.
Les lignes où Argon perd
Le tableau contient aussi le détail qui empêche de parler de domination totale. Claude Opus 5.5 garde Terminal-Bench 4.0, un test de résolution de tâches dans un terminal, avec 66,4 % contre 57,4 % pour Argon. GPT-6 Astra devance Argon sur FrontierSWE v2, un autre test de développement logiciel, avec 65,5 % contre 55,0 %.
La liste continue. Opus 5.5 mène aussi sur PostTrainBench (49,3 % contre 45,3 %), et Astra sur Terminal-Bench Science (68,1 % contre 57,6 %) comme sur OSWorld-2.0, qui mesure l'usage d'un ordinateur (72,6 % contre 69,2 %). Au total, Argon cède 5 catégories sur 18, dont les deux tests menés dans un terminal.
Ce contraste est utile pour un acheteur. Une entreprise ne choisit pas un modèle en additionnant ses trophées. Elle regarde le type de travail qui compte, les critères d'acceptation et le niveau de reprise humaine.
Pour suivre cette course, vous pouvez aussi comparer Claude Sonnet 5.5 et son coût par tâche ou relire notre analyse de l'OpenAI DevDay 2026. Ces repères ne remplacent pas un pilote, mais ils évitent de lire un lancement isolément.
Le test indépendant refroidit-il la couronne ? Un peu
Artificial Analysis change la perspective
Le tableau de Google n'est pas la seule mesure disponible. Artificial Analysis, une plateforme indépendante qui agrège des évaluations de modèles, attribue à Argon 53 points sur son Intelligence Index v4.3.2. GPT-6 Astra obtient aussi 53, tandis que Claude Opus 5.5 atteint 58.
Le coût moyen par tâche observé dans ce protocole est de 1,99 dollar pour Argon, contre 3,26 dollars pour Astra et 5,98 dollars pour Opus. Ce chiffre inclut la consommation mesurée dans le protocole. Il n'est pas équivalent au tarif théorique par token annoncé par Google.
La comparaison Artificial Analysis donne aussi 57 % à Argon contre 60 % à Opus 5.5 sur Terminal-Bench 4.0. Argon semble donc moins cher par tâche dans ce protocole, tout en restant derrière Opus sur le code évalué. Il reprend l'avantage sur AutomationBench-AA (78 % contre 70 %). Pour une PME, cette combinaison est probablement plus utile qu'un classement général : coût, réussite et périmètre doivent être lus ensemble.
Le comparatif affiche un Intelligence Index de 53 contre 58, un coût par tâche de 1,99 dollar contre 5,98 dollars et 57 % contre 60 % sur Terminal-Bench 4.0. C'est une mesure indépendante, dans un protocole donné, pas une promesse universelle.
Notez l'écart sur Terminal-Bench 4.0 : 9 points d'avance pour Opus dans le tableau de Google (66,4 % contre 57,4 %), 3 points chez Artificial Analysis (60 % contre 57 %). Les deux mesures n'utilisent ni le même protocole ni les mêmes réglages de raisonnement. Un score n'a de sens qu'avec sa méthode.
Pourquoi le prix par token ne suffit pas
Deux modèles peuvent recevoir la même demande et consommer un volume différent de tokens. Le moins cher au million peut donc coûter plus cher pour parvenir à un résultat accepté. Ajoutez le temps de vérification, les relances et les erreurs.
Artificial Analysis l'illustre bien : Argon produit en moyenne 62 000 tokens de sortie par tâche, contre 119 000 pour Opus 5.5. Moitié moins de tokens, à tarif égal après la promotion : l'écart de coût se joue là, plus que dans le prix affiché.
Chez Koul, cette logique rejoint notre méthode de cadrage : partir d'un besoin mesurable, définir ce qui sera accepté et observer le résultat complet. Le score compte, mais le coût par tâche réussie compte davantage.
« Benchmaxxing » : accusation sérieuse, preuve encore absente
Ce que reprochent les témoignages
Le terme « benchmaxxing » désigne l'optimisation d'un modèle pour réussir des tests standardisés plutôt que pour bien travailler. Un candidat peut réussir un examen sans démontrer la même maîtrise dans le métier.
Bloomberg rapporte une défiance interne : des personnes ayant accès au modèle le jugent moins bon en code et en front-end dans l'usage réel. Deux d'entre elles estiment qu'Argon est touché par le benchmaxxing. Google conteste cette lecture, et un autre employé évoque au contraire un large consensus interne en faveur d'un modèle au niveau de la frontière.
Edwin Chen, fondateur de Surge AI, résume le doute avec une image : un enfant peut briller au SAT, l'examen d'entrée des universités américaines, mais ce score « ne se traduit pas en performance réelle ». Ces témoignages sont anonymes et contradictoires. Ils expliquent l'accusation, ils ne prouvent aucune triche.
Le modèle n'est jamais seul
Dans la pratique, vous n'achetez pas un modèle isolé. Vous utilisez un modèle, un outil, des permissions, un contexte documentaire, des connecteurs et une étape de vérification. Cet ensemble forme le harnais agentique : les outils qui permettent au modèle d'agir, de contrôler son résultat et de corriger sa trajectoire.
Annoncée le 19 mai 2026, la bascule de Gemini CLI vers Antigravity CLI est effective depuis le 18 juin : Gemini CLI ne sert plus les abonnés Google AI Pro et Ultra ni les utilisateurs individuels gratuits. Google présente Antigravity comme une interface orientée vers les workflows multi-agents, tout en précisant qu'il n'y avait pas de parité fonctionnelle immédiate. Le débat des développeurs sur Antigravity CLI, Claude Code et Codex reste donc ouvert. Les sources disponibles ne fournissent pas de classement indépendant robuste de ces outils.
Un benchmark évalue surtout le modèle dans un protocole donné. Votre entreprise achète une chaîne complète : modèle, outil, données, sécurité et validation.
Le verdict honnête : impossible de trancher avant le terrain
La bonne nuance
Argon mérite l'attention. Google montre une couverture impressionnante, et Artificial Analysis confirme un niveau global proche d'Astra avec un coût par tâche inférieur dans son protocole. Mais le modèle reste en accès limité, perd certains tests de code et fait l'objet de témoignages contradictoires.
Un modèle non encore accessible ne peut être jugé ni sur ses benchmarks seuls, ni sur quelques témoignages. Il faut attendre l'ouverture progressive, reproduire les essais dans des conditions comparables et distinguer les résultats du fournisseur des mesures indépendantes.
La méthode PME en quatre questions
Un pilote utile peut tenir sur 10 tâches réelles, choisies dans le travail quotidien. Pour chacune, définissez un résultat attendu et une personne chargée de valider la sortie.
- Quelles tâches créent le plus de valeur : code, analyse de documents, support, finance ou recherche ?
- Quel couple modèle et outil s'intègre à vos accès, à vos données et à vos habitudes ?
- Quel est le coût d'une tâche réussie, reprise humaine comprise ?
- Quel niveau de sécurité, de traçabilité et de réversibilité exigez-vous ?
Un cadrage peut aider à formaliser ces critères avant de comparer les modèles. Le pilote doit mesurer le résultat accepté, pas seulement la réponse la plus impressionnante.
La première place d'un benchmark attire l'attention. La première place dans votre workflow se mesure autrement.
Pour aller plus loin
- Claude Sonnet 5.5 : plus rapide et moins cher par tâche
- OpenAI DevDay 2026 : les annonces à retenir
- Notre méthode de cadrage de projet
- Automatisation et IA
Sources
- Gemini 4 Argon: our next era of frontier intelligence
- Gemini 4 Argon (High) Intelligence, Performance & Price Analysis
- Gemini 4 Argon (High) vs Claude Opus 5.5
- Google Grapples With Employee Skepticism About New Gemini Model (relais Yahoo Finance)
- An important update: Transitioning Gemini CLI to Antigravity CLI
