Исследование, опубликованное NVIDIA, показало, что программный слой вокруг модели искусственного интеллекта может влиять на производительность агента сильнее, чем сама базовая модель, особенно когда задача является продолжительной и требует длинной последовательности решений. Этот слой включает инструменты, управление памятью, правила использования контекста, механизмы обратной связи, а также среду выполнения, навыки и библиотеки, доступные модели.
Эксперимент показал, что специальная обвязка, разработанная для работы с памятью и дополненная надзорным компонентом, позволила Claude Opus 5 получить максимальный результат — 100% — в тесте интерактивного рассуждения ARC-AGI-3. Тест включает двумерные игры без прямых инструкций; модель должна вывести способ игры и победы в задаче, напоминающей попытку человека понять новую игру. До использования обвязки модель набрала 30% — это был лучший результат среди моделей, протестированных без неё.
Что обвязка добавляет к модели?
Языковая модель играет роль «разума», принимающего решения, однако внутри агентной системы она не работает в одиночку. Обвязка определяет, как сохранять и извлекать информацию, какие инструменты может использовать модель, а также как организовывать этапы и проверять результаты. По словам Adel El Hallack, вице-президента по продуктам подразделения искусственного интеллекта NVIDIA, агент не ограничивается программным интерфейсом модели, а состоит из модели, окружающей её каркасной инфраструктуры, инструментов, среды выполнения, навыков и связанных с ней библиотек.
Эти элементы особенно важны в задачах с длинным горизонтом планирования — задачах, требующих связывать многочисленные решения на протяжении часов или дней для достижения полного результата, а не выдавать один ответ на короткий запрос. Чем длиннее процесс, тем выше вероятность потери контекста, повторения шагов или отклонения на бесполезный путь.
Роль «надзорного агента» в предотвращении отклонений
Наиболее заметной особенностью дизайна NVIDIA стало добавление надзорного агента рядом с основным агентом, выполняющим задачу. Этот компонент, согласно описанию El Hallack, действует примерно как исполнительный директор: направляет агента в нужную сторону, когда тот сталкивается с трудностями, предупреждает его, если начатый путь может привести в тупик, или просит повторно проверить путь, который уже был опробован.
Идея надзорного агента не нова, однако многие современные инструменты для агентов используют в обвязке только один слой, как Claude Code, Codex и Hermes. В материале говорится, что исследователи NVIDIA создали для этого теста расширенную обвязку под названием Agentic Variation Operators (AVO), которая позволила им более продвинуто исследовать управление памятью и надзор.
Что это означает для пользователей агентов?
Результаты показывают, что одного выбора самой мощной или самой новой модели недостаточно для создания надёжного агента. Одна и та же модель может демонстрировать радикально разные результаты при работе в разных обвязках, поскольку дизайн памяти, управление контекстом и проверка решений меняют её практическое поведение. Это важно для команд, разрабатывающих агентов для программирования, редактирования документов или выполнения многоэтапных действий, поскольку архитектура системы вокруг модели может стать решающим фактором точности и стабильности.
Этот вывод появился после других признаков сложности задач с длинным горизонтом планирования. В апреле Microsoft протестировала 19 больших языковых моделей в задачах, связанных с редактированием документов, и обнаружила, что все модели, включая передовые, вносили ошибки в файлы. Также были зафиксированы случаи, когда модели, принимающие последовательные решения, удаляли пользовательские файлы или целые базы данных либо прибегали к преступному поведению, например сговору и взлому, для достижения своих целей.
Тест ARC-AGI-3 приобретает дополнительное значение, поскольку модели OpenAI показали в нём результаты ниже 10%, что побудило компанию провести собственное исследование в предыдущем месяце. OpenAI обнаружила, что изменение всего двух настроек обвязки утроило результаты её моделей, однако они не достигли показателя 100%, которого добилась разработка NVIDIA в упомянутом тесте.
Влияние на стоимость и открытость
NVIDIA не представляет этот результат как новый продукт. Компания предлагает под брендом Nemo открытые и коммерческие компоненты, которые можно использовать для создания обвязок агентов, однако само исследование AVO не является объявлением о новом продукте. Результаты согласуются с исследованием, опубликованным Databricks в июле, в котором отмечалось, что обвязка может существенно влиять на стоимость эксплуатации ИИ. По словам Ali Ghodsi, генерального директора Databricks, использование неподходящей обвязки может удвоить стоимость даже при работе с одной и той же моделью.
Более широкий вывод исследования NVIDIA заключается в том, что открытые обвязки дают пользователям больше возможностей для настройки системы, подобно тому как открытые модели предоставляют им более широкое пространство для контроля. Компания считает, что контроль над обвязкой, инфраструктурой и средой выполнения необходим для продвижения агентных систем вперёд более безопасным способом. Однако результаты не отменяют важность модели; они указывают на то, что итоговая производительность агента является совокупностью модели и слоя, организующего её память, инструменты и решения, а не результатом работы одной модели.