Google anunció el modelo Gemini 4 Argon, un modelo de inteligencia artificial orientado a tareas profesionales de larga duración que requieren razonamiento de varios pasos, como ingeniería de software, investigación financiera, redacción jurídica y defensa cibernética. La empresa afirma que el modelo eleva el límite de salida a un millón de tokens, frente a los 64 mil tokens anteriores, lo que le permite procesar flujos de trabajo prolongados y producir resultados extensos dentro de una sola tarea.
Despliegue limitado antes de la disponibilidad general
Google comenzó a ofrecer Argon a un grupo de defensores de confianza en ciberseguridad a través del programa Fairwind. También afirma que participa en el proceso voluntario del Gobierno estadounidense relativo al acceso a modelos antes de su lanzamiento, y tiene previsto ampliar gradualmente el acceso después de recopilar los comentarios de los evaluadores y mejorar los mecanismos de protección.
El precio introductorio comenzará en 2 dólares por cada millón de tokens de entrada y 10 dólares por cada millón de tokens de salida, con un descuento del 95% para los tokens de entrada almacenados en caché. Tras finalizar el periodo introductorio, el precio aumentará a 4 dólares por la entrada y 20 dólares por la salida por cada millón de tokens. Google afirma que la disponibilidad más amplia comenzará con los clientes de pago a través de API y los suscriptores de Google AI Ultra, y después llegará a desarrolladores, empresas y consumidores.
Rendimiento en programación y trabajo empresarial
Google señala que Argon obtuvo un resultado del 77,9% en el estándar DeepSWE v1.1 para tareas de ingeniería de software de larga duración, y que encabezó el índice Vals, que mide el impacto económico en los ámbitos financiero, de programación, jurídico y fiscal. También lideró el estándar AutomationBench de Zapier con un resultado del 51,3%, y alcanzó el 91,7% en LVBench para la comprensión de vídeos largos.
Dentro de Google, el modelo se utilizó para mejorar algoritmos de computación cuántica, analizar datos de consumo de memoria en centros de datos y migrar bases de código de C y C++ a Rust. La empresa afirma que las mejoras de memoria liberaron más de 300 terabytes tras su aplicación, con un ahorro total estimado de entre 500 terabytes y 1 petabyte. En la biblioteca libgav1, Argon sustituyó aproximadamente 32 mil líneas de código SIMD, lo que dio lugar a una versión en Rust 2,7 veces más rápida que el puerto anterior en Rust, manteniendo las mismas salidas de vídeo. Google confirma que los procesos de migración se someten a auditoría, pruebas y revisión antes de publicarse en producción.
Enfoque especial en la defensa cibernética
Google entrenó Argon para detectar, verificar y corregir vulnerabilidades de software de forma autónoma. Afirma que Wiz lo utiliza dentro de la iniciativa Scan for Good para proteger infraestructuras públicas, y que el modelo descubrió en una prueba inicial una vulnerabilidad crítica que exponía datos personales sensibles en software sanitario utilizado por hospitales de todo el mundo. En el estándar CWE-bench v1 para la corrección de vulnerabilidades, Argon empató en el primer puesto con un resultado del 68%.
¿Qué cambia en la práctica?
Argon representa un paso del uso del modelo para respuestas breves a la ejecución de flujos de trabajo profesionales prolongados que incluyen análisis, ejecución y revisión. Sin embargo, los resultados mencionados proceden de Google o de sus socios y de estándares específicos, y no implican necesariamente un rendimiento equivalente en todos los entornos de producción. Además, la disponibilidad actual es limitada, y Google mantiene el acceso público condicionado a pruebas de seguridad y a la mejora de la resistencia frente al uso indebido, la inyección indirecta de instrucciones y los riesgos de desalineación.
La empresa afirma que supervisa el comportamiento y los procedimientos del modelo, y que refuerza el aislamiento de los entornos utilizados en la formación y en las evaluaciones de alto riesgo. También ofrecerá inicialmente Argon sin algunas de las barreras cibernéticas a los defensores de confianza y a sus equipos internos, una decisión que aumenta la capacidad defensiva potencial, pero convierte la selección de usuarios y la supervisión operativa en elementos fundamentales para la seguridad del lanzamiento.