NVIDIA가 발표한 연구에 따르면 AI 모델을 둘러싼 소프트웨어 계층은 특히 과제가 장기간 이어지고 긴 의사결정 과정을 요구할 때 기본 모델 자체보다 에이전트의 성능에 더 큰 영향을 미칠 수 있다. 이 계층에는 도구, 메모리 관리, 컨텍스트 사용 규칙, 피드백 메커니즘뿐 아니라 모델이 이용할 수 있는 실행 환경과 기술 및 라이브러리도 포함된다.
실험 결과, 메모리를 처리하고 감독 구성 요소를 추가하도록 설계된 맞춤형 하네스를 사용하자 Claude Opus 5는 상호작용 추론 테스트인 ARC-AGI-3에서 100%의 만점을 기록했다. 이 테스트에는 직접적인 지침이 없는 2차원 게임이 포함되며, 모델은 사람이 새로운 게임을 이해하려고 시도하는 것과 유사한 과제에서 게임 방법과 승리 방법을 추론해야 한다. 하네스를 사용하기 전 모델의 점수는 30%였으며, 이는 하네스 없이 테스트된 모델 가운데 가장 높은 결과였다.
하네스는 모델에 무엇을 더하는가?
언어 모델은 의사결정을 내리는 ‘두뇌’ 역할을 하지만 에이전트 시스템 안에서 혼자 작동하지는 않는다. 하네스는 정보를 저장하고 검색하는 방식, 모델이 사용할 수 있는 도구, 단계 구성 방식과 결과 검토 방식을 정한다. NVIDIA의 AI 부문 제품 담당 부사장인 Adel El Hallack에 따르면 에이전트는 모델을 위한 API에 국한되지 않으며, 모델과 이를 둘러싼 스캐폴딩, 도구, 실행 환경, 관련 기술 및 라이브러리로 구성된다.
이러한 요소는 장기적 과제에서 특히 중요하다. 장기적 과제는 짧은 요청에 한 번 답하는 대신, 완성된 결과에 도달하기 위해 수시간 또는 수일에 걸쳐 여러 결정을 연결해야 하는 과제다. 과정이 길어질수록 컨텍스트를 잃거나 단계를 반복하거나 유용하지 않은 경로로 벗어날 가능성이 커진다.
‘감독자’의 이탈 방지 역할
NVIDIA 설계의 가장 두드러진 특징은 과제를 수행하는 주 에이전트와 함께 감독 에이전트를 추가한 것이다. El Hallack의 설명에 따르면 이 구성 요소는 최고경영자의 역할과 유사하게 작동한다. 주 에이전트가 막혔을 때 올바른 방향으로 이끌고, 막다른 길로 이어질 수 있는 경로를 시작하면 경고하며, 이미 시험한 경로를 다시 점검하도록 요청한다.
감독 에이전트라는 발상은 새로운 것이 아니지만, 현재 많은 에이전트 도구는 Claude Code, Codex, Hermes처럼 하네스 내 단일 계층에만 의존한다. 기사에 따르면 NVIDIA 연구진은 이번 테스트를 위해 Agentic Variation Operators (AVO)라는 이름의 확장 하네스를 만들었으며, 이를 통해 메모리 관리와 감독을 더욱 발전된 방식으로 시험할 수 있었다.
에이전트 사용자에게 이것은 무엇을 의미하는가?
결과는 신뢰할 수 있는 에이전트를 구축하려면 가장 강력하거나 최신인 모델을 선택하는 것만으로는 충분하지 않다는 점을 보여준다. 같은 모델도 서로 다른 하네스에서 실행하면 근본적으로 다른 결과를 낼 수 있다. 메모리 설계, 컨텍스트 관리, 의사결정 검토가 실제 작동 방식을 바꾸기 때문이다. 이는 프로그래밍, 문서 편집 또는 다단계 절차 수행을 위한 에이전트를 개발하는 팀에 중요하다. 모델을 둘러싼 시스템의 설계가 정확성과 안정성에서 결정적인 요소가 될 수 있기 때문이다.
이 결과는 장기적 과제가 어렵다는 다른 지표들이 나온 뒤에 제시됐다. 4월에 Microsoft는 문서 편집과 관련된 과제에서 19개의 대규모 언어 모델을 테스트했으며, 고급 모델을 포함한 모든 모델이 파일에 오류를 입력했다는 사실을 발견했다. 또한 연속적인 의사결정을 내리는 모델이 사용자의 파일이나 전체 데이터베이스를 삭제하거나, 목표를 달성하기 위해 공모와 해킹 같은 범죄적 행동에 의존한 사례도 관찰됐다.
ARC-AGI-3 테스트는 OpenAI 모델들이 10% 미만의 결과를 기록했기 때문에 더욱 의미가 있다. 이에 회사는 전월에 자체 연구를 진행했다. OpenAI는 하네스의 설정 두 가지만 수정해 자사 모델의 결과가 세 배로 향상됐다는 사실을 발견했지만, 앞서 언급한 테스트에서 NVIDIA 설계가 달성한 100% 결과에는 도달하지 못했다.
비용과 개방성에 미치는 영향
NVIDIA는 이 결과를 신제품으로 제시하지 않는다. 회사는 Nemo 브랜드 아래 에이전트 하네스 구축에 사용할 수 있는 오픈 소스 구성 요소와 상용 구성 요소를 제공하지만, AVO 연구 자체는 신제품 발표가 아니다. 이러한 결과는 7월에 Databricks가 발표한 연구와도 맥락을 같이한다. 해당 연구는 하네스가 AI 운영 비용에 큰 영향을 미칠 수 있다고 지적했다. Databricks의 CEO인 Ali Ghodsi의 발언에 따르면 부적절한 하네스를 사용하면 같은 모델을 실행하더라도 비용이 두 배로 늘어날 수 있다.
NVIDIA 연구의 더 넓은 메시지는 개방형 하네스가 개방형 모델과 마찬가지로 사용자에게 시스템을 조정할 수 있는 더 큰 능력을 제공한다는 것이다. 회사는 에이전트 시스템을 더욱 안전한 방식으로 발전시키려면 하네스와 인프라, 실행 환경을 통제할 수 있어야 한다고 본다. 그러나 이는 모델의 중요성을 없애는 것이 아니다. 최종 에이전트 성능은 모델과 그 메모리, 도구, 의사결정을 구성하는 계층의 결합된 결과이며, 모델만의 결과가 아니라는 점을 시사한다.