Una investigación publicada por NVIDIA concluyó que la capa de software que rodea al modelo de inteligencia artificial puede influir en el rendimiento del agente más que el propio modelo base, especialmente cuando la tarea es prolongada y requiere una larga serie de decisiones. Esta capa incluye las herramientas, la gestión de la memoria, las reglas de uso del contexto y los mecanismos de retroalimentación, además del entorno de ejecución, las habilidades y las bibliotecas disponibles para el modelo.
El experimento mostró que el uso de un arnés personalizado, diseñado para gestionar la memoria y al que se añadió un componente supervisor, permitió a Claude Opus 5 obtener una puntuación perfecta del 100 % en la prueba ARC-AGI-3 de razonamiento interactivo. La prueba incluye juegos bidimensionales sin instrucciones directas, y el modelo debe deducir cómo jugar y ganar, en una tarea similar al intento de un ser humano por comprender un juego nuevo. Antes de utilizar el arnés, el modelo obtuvo un 30 %, la puntuación más alta entre los modelos probados sin él.
¿Qué añade el arnés al modelo?
El modelo lingüístico desempeña el papel del «cerebro» que toma las decisiones, pero no funciona por sí solo dentro del sistema agéntico. El arnés determina cómo se guarda y recupera la información, qué herramientas puede utilizar el modelo y cómo se organizan los pasos y se revisan los resultados. Según Adel El Hallack, vicepresidente de productos de la unidad de inteligencia artificial de NVIDIA, el agente no se limita a una interfaz de programación de aplicaciones para el modelo, sino que está compuesto por el modelo, las estructuras auxiliares que lo rodean, las herramientas, el entorno de ejecución, las habilidades y las bibliotecas asociadas.
Estos elementos adquieren especial importancia en las tareas de horizonte largo, es decir, aquellas que requieren encadenar numerosas decisiones durante horas o días para llegar a un resultado completo, en lugar de ofrecer una sola respuesta a una solicitud breve. Cuanto más largo es el proceso, mayores son las probabilidades de perder el contexto, repetir pasos o desviarse hacia una ruta inútil.
El papel del «supervisor» para evitar desviaciones
La característica más destacada del diseño de NVIDIA fue la incorporación de un agente supervisor junto al agente principal que ejecuta la tarea. Este componente, según la descripción de El Hallack, funciona de manera similar a un director ejecutivo: impulsa al agente en la dirección correcta cuando se atasca, le advierte si inicia una ruta que podría llevarlo a un callejón sin salida o le pide que vuelva a examinar una ruta que ya había probado.
La idea del agente supervisor no es nueva, pero muchas de las herramientas actuales para agentes dependen de una sola capa en el arnés, como Claude Code, Codex y Hermes. El artículo señala que los investigadores de NVIDIA crearon para esta prueba un arnés ampliado al que llamaron Agentic Variation Operators (AVO), lo que les permitió probar la gestión de la memoria y la supervisión de forma más avanzada.
¿Qué significa esto para los usuarios de agentes?
Los resultados muestran que elegir el modelo más potente o más reciente no basta por sí solo para construir un agente fiable. El mismo modelo puede lograr resultados radicalmente distintos cuando se ejecuta dentro de arneses diferentes, porque el diseño de la memoria, la gestión del contexto y la revisión de las decisiones modifican su funcionamiento práctico. Esto es importante para los equipos que desarrollan agentes para programar, editar documentos o ejecutar procedimientos de varios pasos, ya que la ingeniería del sistema que rodea al modelo puede ser un factor decisivo para la precisión y la estabilidad.
Este resultado llega después de otros indicios sobre la dificultad de las tareas de horizonte largo. En abril, Microsoft probó 19 modelos lingüísticos grandes en tareas relacionadas con la edición de documentos y descubrió que todos los modelos, incluidos los avanzados, introdujeron errores en los archivos. También se registraron casos en los que modelos que tomaban decisiones consecutivas eliminaron archivos de los usuarios o bases de datos completas, o recurrieron a comportamientos delictivos, como la colusión y la intrusión informática, para alcanzar sus objetivos.
La prueba ARC-AGI-3 adquiere una importancia adicional porque los modelos de OpenAI obtuvieron en ella resultados inferiores al 10 %, lo que llevó a la empresa a realizar su propia investigación el mes anterior. OpenAI descubrió que modificar solo dos ajustes del arnés triplicó los resultados de sus modelos, pero no alcanzó el resultado del 100 % que logró el diseño de NVIDIA en la prueba mencionada.
El impacto en el coste y la apertura
NVIDIA no presenta este resultado como un producto nuevo. La empresa ofrece bajo la marca Nemo componentes abiertos y comerciales que pueden utilizarse para construir arneses para agentes, pero la investigación sobre AVO no constituye en sí misma el anuncio de un producto nuevo. Los resultados coinciden con una investigación publicada por Databricks en julio, que señaló que el arnés puede influir considerablemente en el coste de ejecutar la inteligencia artificial. Según declaró Ali Ghodsi, director ejecutivo de Databricks, utilizar un arnés inadecuado puede duplicar el coste incluso cuando se ejecuta el mismo modelo.
El mensaje más amplio de la investigación de NVIDIA es que los arneses abiertos ofrecen a los usuarios una mayor capacidad para ajustar el sistema, del mismo modo que los modelos abiertos les proporcionan un margen de control más amplio. La empresa considera que disponer de control sobre el arnés, la infraestructura y el entorno de ejecución es necesario para impulsar los sistemas agénticos de forma más segura. Sin embargo, los resultados no eliminan la importancia del modelo; indican que el rendimiento final del agente es el resultado conjunto del modelo y de la capa que organiza su memoria, sus herramientas y sus decisiones, y no del modelo por separado.