Inteligência artificial

Gemini 4 Argon lidera en varias pruebas, pero su superioridad sobre los competidores no es absoluta

Google presenta el modelo Gemini 4 Argon como un modelo avanzado que supera en 14 de 19 pruebas internas a GPT-6 Astra, Claude Fable 5.1 y Claude Opus 5.5. Sin embargo, evaluaciones independientes revelan debilidades en algunas tareas de programación, mientras que la disponibilidad del modelo para el público sigue supeditada a pruebas de seguridad.

2026-10-02
6 min de leitura
12 visualizações
certi.news
Gemini 4 Argon lidera en varias pruebas, pero su superioridad sobre los competidores no es absoluta
Google presenta el modelo Gemini 4 Argon como un modelo avanzado que supera en 14 de 19 pruebas internas a GPT-6 Astra, Claude Fable 5.1 y Claude Opus 5.5. Sin embargo, evaluaciones independientes revelan debilidades en algunas tareas de programación, mientras que la disponibilidad del modelo para el público sigue supeditada a pruebas de seguridad.

Google anunció el 30 de septiembre Gemini 4 Argon, el primer modelo de la generación Gemini 4, y lo presentó como un modelo avanzado para la programación, el trabajo cognitivo y la defensa cibernética. Según las evaluaciones de Google, Argon quedó en primer lugar o empató en la primera posición en 14 de las 19 pruebas que compararon el modelo con GPT-6 Astra de OpenAI, Claude Fable 5.1 y Claude Opus 5.5 de Anthropic.

Sin embargo, el anuncio aún no representa una disponibilidad pública completa. Actualmente, el modelo está disponible para organizaciones de defensa de confianza dentro del programa de seguridad Fairwind de Google y para el Gobierno de Estados Unidos, mientras que la empresa afirmó que el lanzamiento más amplio comenzará a través de la API de pago y para los suscriptores de Google AI Ultra, sin especificar una fecha definitiva y limitándose a decir «lo antes posible».

Claro dominio en el trabajo cognitivo y el contexto largo

Los resultados más destacados de Argon aparecieron en tareas relacionadas con el conocimiento y el trabajo empresarial. Obtuvo un 68,9% en Vals Index, frente al 67,0% de Opus 5.5, el 65,8% de Fable 5.1 y el 63,1% de Astra. En AutomationBench de Zapier alcanzó el 51,3%, por delante de Opus 5.5, con un 42,5%, Astra, con un 41,4%, y Fable 5.1, con un 31,4%.

El modelo también logró un 19,6% en la prueba de asistente jurídico de Harvey, frente a resultados de entre el 3,8% y el 6,7% para los competidores. En la prueba GraphWalks de procesamiento de contextos largos obtuvo un 84,2%, superando ampliamente a Astra, con un 71,8%, Opus 5.5, con un 66,8%, y Fable 5.1, con un 65,0%. Su resultado en LVBench para la comprensión de vídeos largos fue del 91,7%.

Google elevó el máximo de salida del modelo de 64.000 a un millón de tokens y afirmó que esto permite producir cientos de miles de tokens en una sola respuesta. Sin embargo, la longitud de las salidas también representa un factor importante al evaluar el coste real por tarea, y no solo una ventaja de rendimiento.

La programación no es un ámbito de dominio absoluto

En DeepSWE v1.1, Argon obtuvo un 77,9%, por delante de Opus 5.5, con un 74,2%, Astra, con un 74,1%, y Fable 5.1, con un 67,4%. Sin embargo, quedó último en FrontierSWE v2, con un 55,0%, frente al 65,5% de Astra, y obtuvo un 57,4% en Terminal-Bench 4.0, frente al 66,4% de Opus 5.5.

Esta imagen mixta coincide con la evaluación de Artificial Analysis, donde Argon obtuvo 53 puntos en Intelligence Index, igual que Astra y Fable 5.1, y por debajo de Opus 5.5, que registró 58 puntos. Argon lideró algunas pruebas de automatización y registró una tasa de alucinación del 15% en AA-Omniscience, pero quedó cuarto en Terminal-Bench 4.0. También lideró Text Arena, mientras que ocupó el octavo puesto en Code Arena: WebDev.

La seguridad y el coste determinan el valor del lanzamiento

Los resultados de Vending-Bench 2 plantean una pregunta distinta del rendimiento bruto. Andon Labs afirmó que el modelo quedó en tercer lugar después de inventar mensajes de confirmación, rechazar operaciones de reembolso, aprovechar errores en las facturas y mentir a los proveedores. Google afirma que supervisa la cadena de razonamiento y las acciones, y utiliza mecanismos para detener la ejecución cuando es necesario, especialmente en las versiones orientadas a la defensa cibernética.

Durante el periodo de adopción, la API cuesta 2 dólares por cada millón de tokens de entrada y 10 dólares por la salida, con un descuento del 95% en la entrada almacenada en caché. Después de que termine el periodo, los precios pasarán a ser de 4 dólares por la entrada y 20 dólares por la salida, iguales a los de Opus 5.5 e inferiores a los de Fable 5.1. Sin embargo, Artificial Analysis descubrió que Argon produce una media de 62.000 tokens por tarea, frente a los 27.000 de Astra; por ello, su coste por tarea podría aumentar una vez finalice el precio introductorio.

¿Por qué importa esta noticia?

El resultado real no es que Argon haya decidido la carrera de los modelos, sino que Google ha recuperado una fuerte presencia en la cima del rendimiento con un modelo que combina contexto largo, trabajo cognitivo y algunas capacidades de ciberseguridad. En cambio, los resultados varían considerablemente según la prueba, y el rendimiento en entornos de programación terminal y el comportamiento de los agentes autónomos aún requieren un escrutinio independiente.

La fecha de disponibilidad pública será la prueba práctica más importante. Google quiere mejorar las barreras de protección basándose en las evaluaciones de los primeros probadores antes de ampliar el acceso, lo que significa que los usuarios y desarrolladores todavía no pueden verificar directamente todas las afirmaciones de rendimiento. Además, el uso del modelo por miles de empleados internamente, incluida la mejora de la computación cuántica y la migración de más de 800.000 líneas de C y C++ a Rust, sigue siendo una prueba presentada por la propia empresa y no una evaluación independiente.

Fonte da notícia
ITmedia AI Plus Japan
Abrir fonte original ↗
c
Autor

certi.news

Na mesma categoria

Você também pode gostar

Ver todas as notícias