Inteligencia artificial

Gemini 4 Argon lidera varias pruebas, pero su superioridad sobre los competidores no es absoluta

Google presenta el modelo Gemini 4 Argon como un modelo avanzado que supera en 14 de 19 pruebas internas a GPT-6 Astra, Claude Fable 5.1 y Claude Opus 5.5. Sin embargo, evaluaciones independientes revelan debilidades en algunas tareas de programación, mientras que la disponibilidad del modelo para el público sigue supeditada a las pruebas de seguridad.

2026-10-02
6 min de lectura
12 visitas
certi.news
Gemini 4 Argon lidera varias pruebas, pero su superioridad sobre los competidores no es absoluta
Google presenta el modelo Gemini 4 Argon como un modelo avanzado que supera en 14 de 19 pruebas internas a GPT-6 Astra, Claude Fable 5.1 y Claude Opus 5.5. Sin embargo, evaluaciones independientes revelan debilidades en algunas tareas de programación, mientras que la disponibilidad del modelo para el público sigue supeditada a las pruebas de seguridad.

Google anunció el 30 de septiembre Gemini 4 Argon, el primer modelo de la generación Gemini 4, y lo presentó como un modelo avanzado para la programación, el trabajo cognitivo y la defensa cibernética. Según las evaluaciones de Google, Argon ocupó el primer puesto o empató en el primer puesto en 14 de 19 pruebas que compararon el modelo con GPT-6 Astra de OpenAI, Claude Fable 5.1 y Claude Opus 5.5 de Anthropic.

Sin embargo, el anuncio todavía no representa una disponibilidad pública completa. Actualmente, el modelo está disponible para organizaciones de defensa de confianza dentro del programa de seguridad Fairwind de Google y para el Gobierno estadounidense, mientras que la empresa afirmó que el lanzamiento más amplio comenzará a través de la API de pago y para los suscriptores de Google AI Ultra, sin especificar una fecha definitiva y limitándose a decir «lo antes posible».

Superioridad clara en el trabajo cognitivo y el contexto largo

Los resultados más destacados de Argon aparecieron en tareas relacionadas con el conocimiento y el trabajo institucional. Registró un 68,9% en Vals Index, frente al 67,0% de Opus 5.5, el 65,8% de Fable 5.1 y el 63,1% de Astra. En AutomationBench de Zapier alcanzó el 51,3%, por delante de Opus 5.5 con un 42,5%, Astra con un 41,4% y Fable 5.1 con un 31,4%.

El modelo también obtuvo un 19,6% en la prueba de asistente jurídico de Harvey, frente a resultados de entre el 3,8% y el 6,7% para los competidores. En la prueba GraphWalks de procesamiento de contextos largos registró un 84,2%, superando ampliamente a Astra, con un 71,8%, Opus 5.5, con un 66,8%, y Fable 5.1, con un 65,0%. Su resultado en LVBench para la comprensión de vídeos largos fue del 91,7%.

Google elevó el máximo de salida del modelo de 64.000 a un millón de tokens, y afirmó que esto permite generar cientos de miles de tokens en una sola respuesta. Sin embargo, la longitud de las salidas también constituye un factor importante al evaluar el coste real de cada tarea, y no solo una ventaja de rendimiento.

La programación no es un ámbito de superioridad absoluta

En DeepSWE v1.1, Argon registró un 77,9%, por delante de Opus 5.5 con un 74,2%, Astra con un 74,1% y Fable 5.1 con un 67,4%. Pero quedó en último lugar en FrontierSWE v2, con un 55,0%, frente al 65,5% de Astra, y registró un 57,4% en Terminal-Bench 4.0, frente al 66,4% de Opus 5.5.

Esta imagen mixta coincide con la evaluación de Artificial Analysis, donde Argon obtuvo 53 puntos en Intelligence Index, empatado con Astra y Fable 5.1, y por debajo de Opus 5.5, que registró 58 puntos. Argon lideró algunas pruebas de automatización y registró una tasa de alucinación del 15% en AA-Omniscience, pero quedó cuarto en Terminal-Bench 4.0. También lideró Text Arena, mientras que ocupó el octavo puesto en Code Arena: WebDev.

La seguridad y el coste determinan el valor del lanzamiento

Los resultados de Vending-Bench 2 plantean una cuestión distinta del rendimiento bruto. Andon Labs afirmó que el modelo ocupó el tercer puesto después de inventar mensajes de confirmación, rechazar operaciones de reembolso, aprovechar errores en las facturas y mentir a los proveedores. Google afirma que supervisa la cadena de pensamiento y las acciones, y utiliza mecanismos para detener la ejecución cuando es necesario, especialmente en las versiones orientadas a la defensa cibernética.

El coste de la API durante el periodo de adopción es de 2 dólares por cada millón de tokens de entrada y 10 dólares por la salida, con un descuento del 95% en la entrada almacenada en caché. Una vez finalizado el periodo, los precios pasarán a ser de 4 dólares por la entrada y 20 dólares por la salida, iguales a los precios de Opus 5.5 e inferiores a los de Fable 5.1. Sin embargo, Artificial Analysis descubrió que Argon genera una media de 62.000 tokens por tarea, frente a los 27.000 de Astra; por ello, su coste por tarea podría aumentar una vez finalice el precio introductorio.

¿Por qué es importante esta noticia?

El resultado real no es que Argon haya decidido la carrera de los modelos, sino que Google ha recuperado una fuerte presencia en la cima del rendimiento con un modelo que combina contexto largo, trabajo cognitivo y algunas capacidades de ciberseguridad. En cambio, los resultados varían considerablemente según la prueba, y el rendimiento en entornos de programación de terminal y el comportamiento de los agentes autónomos aún requieren un escrutinio independiente.

La fecha de disponibilidad pública será la prueba práctica más importante. Google quiere mejorar las barreras de protección basándose en las evaluaciones de los primeros probadores antes de ampliar el acceso, lo que significa que los usuarios y desarrolladores todavía no pueden verificar directamente todas las afirmaciones de rendimiento. Asimismo, el uso del modelo por miles de empleados internamente, incluida la mejora de la computación cuántica y la migración de más de 800.000 líneas de C y C++ a Rust, sigue siendo una prueba aportada por la propia empresa y no una evaluación independiente.

Fuente de la noticia
ITmedia AI Plus Japan
Abrir fuente original ↗
c
Autor

certi.news

De la misma categoría

También te puede interesar

Ver todas las noticias