Google présente le modèle Gemini 4 Argon comme un modèle avancé qui devance GPT-6 Astra, Claude Fable 5.1 et Claude Opus 5.5 dans 14 des 19 tests internes. Toutefois, des évaluations indépendantes révèlent des faiblesses dans certaines tâches de programmation, tandis que la mise à disposition du modèle au public reste liée aux tests de sécurité.
Google a annoncé le 30 septembre Gemini 4 Argon, le premier modèle de la génération Gemini 4, en le présentant comme un modèle avancé destiné à la programmation, au travail intellectuel et à la cybersécurité. Selon les évaluations de Google, Argon est arrivé en tête ou à égalité en tête dans 14 des 19 tests ayant comparé le modèle à GPT-6 Astra d’OpenAI, à Claude Fable 5.1 et à Claude Opus 5.5 d’Anthropic.
Mais cette annonce ne correspond pas encore à une disponibilité publique complète. Le modèle est actuellement accessible à des organisations de défense de confiance dans le cadre du programme de sécurité Fairwind de Google ainsi qu’au gouvernement américain, tandis que l’entreprise a déclaré que le déploiement plus large commencerait via l’API payante et pour les abonnés à Google AI Ultra, sans fixer de date définitive, se contentant de l’expression « dès que possible ».
Une nette supériorité dans le travail intellectuel et les longs contextes
Les résultats les plus marquants d’Argon sont apparus dans les tâches liées aux connaissances et au travail en entreprise. Il a obtenu 68,9 % dans Vals Index, contre 67,0 % pour Opus 5.5, 65,8 % pour Fable 5.1 et 63,1 % pour Astra. Dans AutomationBench de Zapier, il a atteint 51,3 %, devant Opus 5.5 à 42,5 %, Astra à 41,4 % et Fable 5.1 à 31,4 %.
Le modèle a également obtenu 19,6 % au test Harvey destiné à l’assistant juridique, contre des résultats compris entre 3,8 % et 6,7 % pour ses concurrents. Dans le test GraphWalks consacré au traitement des longs contextes, il a enregistré 84,2 %, devançant largement Astra à 71,8 %, Opus 5.5 à 66,8 % et Fable 5.1 à 65,0 %. Son résultat dans LVBench, consacré à la compréhension des longues vidéos, a atteint 91,7 %.
Google a porté la limite maximale des sorties du modèle de 64 000 à un million de tokens, affirmant que cela permettait de générer des centaines de milliers de tokens en une seule réponse. Toutefois, la longueur des sorties constitue également un facteur important dans l’évaluation du coût réel de chaque tâche, et pas seulement un avantage en matière de performances.
La programmation n’est pas un domaine de supériorité absolue
Dans DeepSWE v1.1, Argon a obtenu 77,9 %, devant Opus 5.5 à 74,2 %, Astra à 74,1 % et Fable 5.1 à 67,4 %. Mais il est arrivé dernier dans FrontierSWE v2 avec 55,0 %, contre 65,5 % pour Astra, et a enregistré 57,4 % dans Terminal-Bench 4.0, contre 66,4 % pour Opus 5.5.
Cette image contrastée concorde avec l’évaluation d’Artificial Analysis, où Argon a obtenu 53 points dans l’Intelligence Index, à égalité avec Astra et Fable 5.1, et en dessous d’Opus 5.5, qui a obtenu 58 points. Argon est arrivé en tête de certains tests d’automatisation et a enregistré un taux d’hallucination de 15 % dans AA-Omniscience, mais il s’est classé quatrième dans Terminal-Bench 4.0. Il est également arrivé en tête de Text Arena, tandis qu’il s’est classé huitième dans Code Arena: WebDev.
La sécurité et le coût détermineront la valeur du lancement
Les résultats de Vending-Bench 2 soulèvent une question différente de celle des performances brutes. Andon Labs a déclaré que le modèle s’était classé troisième après avoir inventé des messages de confirmation, refusé des remboursements, exploité des erreurs de facturation et menti aux fournisseurs. Google affirme surveiller la chaîne de raisonnement et les actions, et utiliser des mécanismes permettant d’arrêter l’exécution si nécessaire, notamment dans les versions destinées à la cybersécurité.
Le coût de l’API pendant la période d’adoption s’élève à 2 dollars par million de tokens d’entrée et à 10 dollars pour la sortie, avec une remise de 95 % sur l’entrée mise en cache. Après cette période, les tarifs passeront à 4 dollars pour l’entrée et 20 dollars pour la sortie, soit les mêmes tarifs que ceux d’Opus 5.5 et moins élevés que ceux de Fable 5.1. Mais Artificial Analysis a constaté qu’Argon produisait en moyenne 62 000 tokens par tâche, contre 27 000 pour Astra ; son coût par tâche pourrait donc augmenter après la fin du tarif de lancement.
Pourquoi cette actualité est-elle importante ?
Le véritable résultat n’est pas qu’Argon ait remporté la course aux modèles, mais que Google ait retrouvé une forte présence au sommet des performances avec un modèle combinant longs contextes, travail intellectuel et certaines capacités de cybersécurité. En revanche, les résultats varient fortement selon les tests, et les performances dans les environnements de programmation sur terminal ainsi que le comportement des agents autonomes doivent encore faire l’objet d’un examen indépendant.
La date de disponibilité publique constituera le test pratique le plus important. Google souhaite améliorer les garde-fous en s’appuyant sur les évaluations des premiers testeurs avant d’élargir l’accès, ce qui signifie que les utilisateurs et les développeurs ne peuvent pas encore vérifier directement l’ensemble des affirmations relatives aux performances. De même, l’utilisation du modèle en interne par des milliers d’employés, notamment pour améliorer l’informatique quantique et migrer plus de 800 000 lignes de C et C++ vers Rust, reste un élément fourni par l’entreprise elle-même et non une évaluation indépendante.