
Tech • IA • Robotique • Jeu
Google a dévoilé Gemini 4 Argon, un nouveau modèle d’IA phare axé sur l’ingénierie logicielle, le travail en entreprise et la cyberdéfense, avec un accès anticipé limité à des équipes de sécurité de confiance en raison de sa capacité à trouver et corriger de graves vulnérabilités de manière autonome.
Gemini 4 Argon est d’abord déployé via Fairwind, l’initiative de sécurité de Google, auprès d’un petit groupe de cyberdéfenseurs de confiance. L’entreprise a indiqué que les capacités du modèle exigent une sortie progressive, avec participation au processus volontaire américain d’examen avant lancement, avant une disponibilité plus large. L’accès doit ensuite s’étendre aux clients API payants, aux abonnés Google AI Ultra, aux entreprises, aux développeurs et aux consommateurs, sans date annoncée.
Google a fixé un prix de lancement de 2 dollars par million de tokens d’entrée et 10 dollars par million de tokens de sortie. Les tokens d’entrée mis en cache, pour le contexte réutilisé, bénéficient d’une remise de 95 %, soit environ 0,10 dollar par million. L’emploi du terme « lancement » suggère que les prix pourraient augmenter ensuite.
Google affirme qu’Argon a été entraîné à gérer de bout en bout des tâches de cyberdéfense, notamment détecter des vulnérabilités critiques, les valider et les corriger de manière autonome. Comme les mêmes connaissances servant à corriger des failles peuvent aussi servir à les exploiter, une version sans garde-fous n’est fournie qu’à des défenseurs de confiance et aux équipes internes de Google. Les versions standard sont conçues pour refuser toute aide aux cyberattaques et à d’autres usages à haut risque.
Lors d’une démonstration précoce avec l’entreprise de sécurité cloud Wiz, Argon a identifié une faille critique dans un logiciel de santé utilisé par des hôpitaux du monde entier, exposant des données personnelles sensibles. Google a indiqué que des modèles de frontière antérieurs n’avaient pas détecté le problème. Ce résultat est présenté comme une preuve que le nouveau modèle peut repérer des vulnérabilités au-delà des systèmes précédents.
Sur CWE Bench V1, qui mesure la capacité des modèles à corriger des vulnérabilités logicielles, Argon a obtenu 68 %, ex æquo à la première place face à des systèmes comme GPT-6 Astra, Claude Opus 5.5 et Grok 4.7. Google a aussi indiqué qu’Argon surpassait son précédent modèle de sécurité, Gemini 3.8 Flash Cyber, lors de tests internes et des benchmarks de pénétration en boîte noire de Wiz sur des cibles web réelles sans accès au code source.
Google a déclaré que des milliers d’employés utilisaient déjà Argon pour le code, la recherche et la rédaction. L’entreprise a cité des usages allant du débogage et des migrations massives de code à la conception d’algorithmes. Dans des travaux sur l’informatique quantique, Argon aurait amélioré de 40 % une base publiée en quelques minutes en optimisant des sous-routines réduisant les « ressources espace-temps », une mesure combinant qubits et opérations de portes.
Des agents Argon sont utilisés pour migrer du code de C et C++ vers Rust, un langage conçu pour prévenir certaines classes de bugs de sûreté mémoire. Google a indiqué que les projets vont de bibliothèques comme RE2 et libgav1 au noyau Fuchsia Zircon, qui compte plus de 800 000 lignes de code. Dans un autre effort interne, des optimisations mémoire pilotées par Argon sur l’ensemble des centres de données de Google ont libéré plus de 300 tébioctets de mémoire, pour des économies totales estimées entre 500 tébioctets et 1 pébioctet.
Sur libgav1, le décodeur vidéo open source de Google, des agents Argon ont remplacé 32 000 lignes de code SIMD réglé à la main par du Rust sûr structuré pour la vectorisation par compilateur. Google affirme avoir obtenu un décodeur sûr en mémoire fonctionnant 2,7 fois plus vite que le port Rust précédent, tout en conservant une sortie vidéo identique et en réduisant l’écart avec la version C++ optimisée.
Google a porté la limite de sortie d’Argon à 1 million de tokens, contre 64 000 auparavant, pour prendre en charge des flux de travail longs et multi-étapes. Sur DeepSuite V1.1, un benchmark d’ingénierie logicielle à long horizon, Argon a atteint 77,9 %. Google a aussi affirmé que le modèle mène sur des benchmarks en finance, juridique, automatisation d’entreprise et compréhension de vidéos longues, dont 51,3 % sur Zapier’s Automation Bench et 91,7 % sur LV Bench.
Google a mis en avant son travail sur quatre domaines de sécurité avant une sortie plus large: prévention des usages abusifs, résistance aux injections de prompt, surveillance des désalignements, et durcissement des environnements d’entraînement et de test. L’entreprise a indiqué utiliser la surveillance des activations du modèle et des traces de raisonnement, ainsi que des tests de red team et des contrôles d’exécution. Dans le même temps, des informations ont émergé selon lesquelles certains employés auraient mis en doute les performances d’Argon lors de tests internes, ce que Google a contesté.
Gemini 4 Argon constitue la tentative la plus solide de Google depuis des mois pour reprendre du terrain sur le segment haut de gamme de l’IA, en combinant des revendications de pointe sur les benchmarks avec un déploiement inhabituellement prudent et centré sur le cyber. Sa véritable valeur dépendra moins des résultats internes que de la capacité des développeurs et des équipes de sécurité externes à constater, en pratique, qu’il est aussi performant que Google l’affirme.
Poser une question