Google a annoncé le modèle Gemini 4 Argon, un modèle d’intelligence artificielle destiné aux tâches professionnelles de longue durée nécessitant un raisonnement en plusieurs étapes, comme l’ingénierie logicielle, la recherche financière, la rédaction juridique et la défense cybernétique. L’entreprise affirme que le modèle porte la limite de sortie à un million de tokens, contre 64 000 tokens auparavant, ce qui lui permet de traiter de longs flux de travail et de produire des résultats étendus dans le cadre d’une seule tâche.
Un déploiement limité avant la mise à disposition générale
Google a commencé à donner accès à Argon à un groupe de défenseurs de confiance en cybersécurité dans le cadre du programme Fairwind. L’entreprise indique également participer au processus volontaire du gouvernement américain concernant l’accès aux modèles avant leur lancement, et prévoit d’élargir progressivement l’accès après avoir recueilli les retours des testeurs et amélioré les mécanismes de protection.
Le tarif promotionnel commencera à 2 dollars par million de tokens d’entrée et à 10 dollars par million de tokens de sortie, avec une remise de 95 % sur les tokens d’entrée mis en cache. Après la période promotionnelle, le tarif passera à 4 dollars pour l’entrée et à 20 dollars pour la sortie par million de tokens. Google affirme que la mise à disposition plus large commencera par les clients payants de l’API et les abonnés à Google AI Ultra, puis s’étendra aux développeurs, aux entreprises et aux consommateurs.
Performances en programmation et dans le travail d’entreprise
Google indique qu’Argon a obtenu un score de 77,9 % sur le benchmark DeepSWE v1.1 consacré aux tâches d’ingénierie logicielle de longue durée, et qu’il a pris la tête de l’indice Vals, qui mesure l’impact économique dans les domaines de la finance, de la programmation, du droit et de la fiscalité. Il a également pris la tête du benchmark AutomationBench de Zapier avec un score de 51,3 %, et obtenu 91,7 % sur LVBench pour la compréhension des vidéos longues.
Au sein de Google, le modèle a été utilisé pour améliorer les algorithmes d’informatique quantique, analyser les données de consommation de mémoire dans les centres de données et migrer des bases de code de C et C++ vers Rust. L’entreprise affirme que les améliorations de la mémoire ont libéré plus de 300 téraoctets après leur mise en œuvre, pour une économie totale estimée entre 500 téraoctets et 1 pétaoctet. Dans la bibliothèque libgav1, Argon a remplacé environ 32 000 lignes de code SIMD, ce qui a produit une version Rust 2,7 fois plus rapide que le précédent portage en Rust, tout en conservant les mêmes sorties vidéo. Google souligne que les migrations font l’objet d’un audit, de tests et d’une revue avant leur déploiement en production.
Un accent particulier sur la défense cybernétique
Google a entraîné Argon à détecter, vérifier et corriger de manière autonome les vulnérabilités logicielles. L’entreprise affirme que Wiz l’utilise dans le cadre de l’initiative Scan for Good afin de protéger les infrastructures publiques, et que le modèle a découvert lors d’une première expérience une vulnérabilité critique qui exposait des données personnelles sensibles dans des logiciels de santé utilisés par des hôpitaux du monde entier. Dans le benchmark CWE-bench v1 consacré à la correction des vulnérabilités, Argon a partagé la première place avec un score de 68 %.
Qu’est-ce qui change concrètement ?
Argon représente un passage de l’utilisation du modèle pour des réponses courtes à l’exécution de flux de travail professionnels prolongés comprenant l’analyse, l’exécution et la révision. Toutefois, les résultats mentionnés proviennent de Google ou de ses partenaires et de benchmarks spécifiques, et ne signifient pas nécessairement que les performances seront similaires dans tous les environnements de production. En outre, l’accès actuel reste limité, et Google maintient que l’accès public est conditionné par des tests de sécurité, l’amélioration de la résistance aux abus et à l’injection indirecte d’instructions, ainsi que par la gestion des risques de non-alignement.
L’entreprise affirme surveiller le comportement et les procédures du modèle, et renforcer l’isolation des environnements utilisés pour l’entraînement et les évaluations à haut risque. Argon sera également lancé dans un premier temps sans certaines barrières cybernétiques auprès des défenseurs de confiance et de ses équipes internes, une décision qui accroît le potentiel de défense, mais fait du choix des utilisateurs et de la supervision opérationnelle des éléments essentiels de la sécurité du déploiement.