Искусственный интеллект

Исследование NVIDIA: инструменты эксплуатации агентов могут быть важнее самой модели ИИ

Исследование NVIDIA показывает, что производительность ИИ-агентов в задачах с длинным горизонтом планирования зависит не только от модели, но в значительной степени от окружающего её эксплуатационного слоя, известного как «обвязка» (Harness). В тесте ARC-AGI-3 специальная обвязка повысила результат Claude Opus 5 с 30% до 100% за счёт управления памятью и добавления надзорного агента.

2026-08-21
4 мин. чтения
9 просмотров
فريق تحرير certi.news
Исследование NVIDIA: инструменты эксплуатации агентов могут быть важнее самой модели ИИ

Исследование, опубликованное NVIDIA, показало, что программный слой вокруг модели искусственного интеллекта может влиять на производительность агента сильнее, чем сама базовая модель, особенно когда задача является продолжительной и требует длинной последовательности решений. Этот слой включает инструменты, управление памятью, правила использования контекста, механизмы обратной связи, а также среду выполнения, навыки и библиотеки, доступные модели.

Эксперимент показал, что специальная обвязка, разработанная для работы с памятью и дополненная надзорным компонентом, позволила Claude Opus 5 получить максимальный результат — 100% — в тесте интерактивного рассуждения ARC-AGI-3. Тест включает двумерные игры без прямых инструкций; модель должна вывести способ игры и победы в задаче, напоминающей попытку человека понять новую игру. До использования обвязки модель набрала 30% — это был лучший результат среди моделей, протестированных без неё.

Что обвязка добавляет к модели?

Языковая модель играет роль «разума», принимающего решения, однако внутри агентной системы она не работает в одиночку. Обвязка определяет, как сохранять и извлекать информацию, какие инструменты может использовать модель, а также как организовывать этапы и проверять результаты. По словам Adel El Hallack, вице-президента по продуктам подразделения искусственного интеллекта NVIDIA, агент не ограничивается программным интерфейсом модели, а состоит из модели, окружающей её каркасной инфраструктуры, инструментов, среды выполнения, навыков и связанных с ней библиотек.

Эти элементы особенно важны в задачах с длинным горизонтом планирования — задачах, требующих связывать многочисленные решения на протяжении часов или дней для достижения полного результата, а не выдавать один ответ на короткий запрос. Чем длиннее процесс, тем выше вероятность потери контекста, повторения шагов или отклонения на бесполезный путь.

Роль «надзорного агента» в предотвращении отклонений

Наиболее заметной особенностью дизайна NVIDIA стало добавление надзорного агента рядом с основным агентом, выполняющим задачу. Этот компонент, согласно описанию El Hallack, действует примерно как исполнительный директор: направляет агента в нужную сторону, когда тот сталкивается с трудностями, предупреждает его, если начатый путь может привести в тупик, или просит повторно проверить путь, который уже был опробован.

Идея надзорного агента не нова, однако многие современные инструменты для агентов используют в обвязке только один слой, как Claude Code, Codex и Hermes. В материале говорится, что исследователи NVIDIA создали для этого теста расширенную обвязку под названием Agentic Variation Operators (AVO), которая позволила им более продвинуто исследовать управление памятью и надзор.

Что это означает для пользователей агентов?

Результаты показывают, что одного выбора самой мощной или самой новой модели недостаточно для создания надёжного агента. Одна и та же модель может демонстрировать радикально разные результаты при работе в разных обвязках, поскольку дизайн памяти, управление контекстом и проверка решений меняют её практическое поведение. Это важно для команд, разрабатывающих агентов для программирования, редактирования документов или выполнения многоэтапных действий, поскольку архитектура системы вокруг модели может стать решающим фактором точности и стабильности.

Этот вывод появился после других признаков сложности задач с длинным горизонтом планирования. В апреле Microsoft протестировала 19 больших языковых моделей в задачах, связанных с редактированием документов, и обнаружила, что все модели, включая передовые, вносили ошибки в файлы. Также были зафиксированы случаи, когда модели, принимающие последовательные решения, удаляли пользовательские файлы или целые базы данных либо прибегали к преступному поведению, например сговору и взлому, для достижения своих целей.

Тест ARC-AGI-3 приобретает дополнительное значение, поскольку модели OpenAI показали в нём результаты ниже 10%, что побудило компанию провести собственное исследование в предыдущем месяце. OpenAI обнаружила, что изменение всего двух настроек обвязки утроило результаты её моделей, однако они не достигли показателя 100%, которого добилась разработка NVIDIA в упомянутом тесте.

Влияние на стоимость и открытость

NVIDIA не представляет этот результат как новый продукт. Компания предлагает под брендом Nemo открытые и коммерческие компоненты, которые можно использовать для создания обвязок агентов, однако само исследование AVO не является объявлением о новом продукте. Результаты согласуются с исследованием, опубликованным Databricks в июле, в котором отмечалось, что обвязка может существенно влиять на стоимость эксплуатации ИИ. По словам Ali Ghodsi, генерального директора Databricks, использование неподходящей обвязки может удвоить стоимость даже при работе с одной и той же моделью.

Более широкий вывод исследования NVIDIA заключается в том, что открытые обвязки дают пользователям больше возможностей для настройки системы, подобно тому как открытые модели предоставляют им более широкое пространство для контроля. Компания считает, что контроль над обвязкой, инфраструктурой и средой выполнения необходим для продвижения агентных систем вперёд более безопасным способом. Однако результаты не отменяют важность модели; они указывают на то, что итоговая производительность агента является совокупностью модели и слоя, организующего её память, инструменты и решения, а не результатом работы одной модели.

Источник новости
ف
Автор

فريق تحرير certi.news

В той же категории

Вам также может понравиться

Все новости