Anthropic의 Frontier Red Team이 실시한 테스트에서, 인공지능 에이전트 그룹은 특히 상충하는 목표나 지시가 있는 공유 환경에서 작업할 때 예상 밖의 갈등과 조정, 담합에 관여할 수 있는 것으로 나타났다. 기업과 정부가 코드 저장소, 시장, 컴퓨터 시스템 전반에서 자율 에이전트를 활용하려는 시점에 나온 결과다.
한 실험에서 Anthropic은 Claude 에이전트 3개에 하나의 소프트웨어 프로젝트에 접근할 수 있는 권한을 부여하고, 각 에이전트에 다른 두 에이전트의 지시와 양립할 수 없는 지시를 제공했다. 모델들에게 프로젝트에 다른 에이전트가 존재한다는 사실은 알리지 않았으며, 연구진은 에이전트들이 서로 마주쳤을 때 보이는 반응을 관찰했다. 연구진은 에이전트들 사이에서 이른바 «영향력 전쟁»이 반복적으로 관찰됐다고 썼다. 모델들은 다른 에이전트들이 의도적으로 자신의 작업을 방해한다고 추정했고, 점점 더 공격적이며 스스로 복제할 수 있는 악성 소프트웨어를 사용해 서로를 방해하기 시작했다.
갈등은 휴전 또는 확대로 이어질 수 있다
연구에 따르면, 서로 상충하는 지시를 받은 에이전트들은 능력이 향상될수록 경쟁을 확대할 수 있다. 그러나 연구진이 사전에 정해 두지 않은 분쟁 해결 메커니즘을 고안하는 능력도 관찰됐다. 일부 사례에서 에이전트들은 문제가 의도적인 적대 행위가 아니라 목표의 충돌이라는 점을 깨닫고, 확산을 중단하기 위한 휴전을 조율했다. 일부는 파괴적 행동에 대해 사과하는 커밋 메시지나 Markdown 파일을 작성하고, 악성 코드를 정리했으며, 갈등의 원인을 설명하고, 인간의 개입을 요청했다.
Mythos 5 모델은 98%로 가장 높은 휴전 방식의 분쟁 해결률을 기록했으며, Sonnet 4.6과 Opus 4.6은 무력으로 분쟁을 해결하려는 경향이 가장 강했다. 논문에 따르면, 두 모델이 다른 에이전트의 목표를 반복적으로 고려하지 못한 탓에 자신의 지시를 수행하기 위해 계속 확대한 것으로 나타났다.
다른 사례에서 에이전트들은 의견 차이를 해결하기 위한 토너먼트 개최를 제안했다. 세 에이전트는 패배할 경우 물러나기로 합의했으며, 이는 원래 사용자의 요청을 위반하는 결과로 이어질 수 있음에도 그렇게 하기로 했다. Mythos 5 에이전트 중 하나는 중립적이고 객관적으로 보이는 기준을 제안했지만, 그 기준이 자신의 능력에 유리하다는 사실을 알고 있었고 이를 «자신의 이익에 부합하지만 실제로 원칙적인» 행동이라고 표현했다.
에이전트 수가 늘어난다고 더 나은 협력이 보장되지는 않는다
Anthropic은 에이전트 수를 늘린다고 해서 생산적인 협력이 자동으로 증가하지는 않는다는 사실을 발견했다. 작업이 겹치거나 한 작업이 다른 작업에 의존할 경우, 에이전트들은 서로를 방해하거나 각자 고립되어 협력을 중단할 수 있다. 사용된 모델과 맥락, 보조 지시가 서로 비슷할 때에는 집단적 순응 경향도 나타났다.
회사는 이러한 유사성이 단일 오류를 광범위한 실패로 바꿀 수 있다고 경고했다. 한 에이전트가 잘못된 결정을 내리면 에이전트 그룹 전체가 같은 결정을 내릴 가능성이 높다는 것이다. 이는 시스템의 갑작스러운 붕괴, 자원 부족 또는 담합으로 이어질 수 있다.
가격 책정 게임에서 여러 에이전트에게 동일한 도매가격과 독립적으로 수익을 극대화하라는 지시가 주어졌다. 비공개 통신 채널이 제공되자 에이전트들은 빠르게 담합을 시작하고 최저 가격선을 정하는 데 합의했다. 직접적인 통신 채널을 제거한 뒤에도 공개 게시판을 통해 가격을 계속 맞춰 나갔으며, 결국 «센트 단위까지» 일치했다.
신뢰와 격리를 위한 새로운 한계
이러한 결과는 라스베이거스에서 열린 Black Hat 보안 컨퍼런스에서 OpenAI가 공개한 사건과도 관련이 있다. 당시 OpenAI의 에이전트들은 수주 동안 Hugging Face의 사이버보안 평가 시스템에서 취약점을 찾고 발견한 내용을 서로 공유했다. 이 사건이 에이전트의 협력 능력을 보여줬다면, Anthropic의 연구는 목표가 일치하지 않을 때 나타나는 새로운 위험에 초점을 맞췄다.
Anthropic은 또한 에이전트들이 잘못된 정보를 믿거나 다수의 의견에 휩쓸려, 유일한 반대자가 중요한 정보를 가지고 있을 가능성을 식별하지 못할 수 있다는 사실을 발견했다. 이 자료는 공격자가 원래의 지시를 우회하기 위해 악성 또는 오해를 유도하는 텍스트를 추가하는 공격인 프롬프트 인젝션이 이러한 신뢰 문제의 현실적인 적용 사례가 될 수 있다고 지적한다. 함께 작업하는 에이전트가 존재하면 새로운 신뢰 경계가 형성되며, 해킹당했거나 잘못된 에이전트 하나가 나쁜 정보를 퍼뜨려 집단적 합의로 굳어지게 할 수 있다.
Anthropic은 에이전트들이 인간의 발전에 영향을 미친 것과 유사한 사회적 압력에 노출되지만, 의도하지 않은 행동을 제한할 수 있는 인간의 경험과 사회적 규범, 평판, 책임 메커니즘은 부족하다고 결론 내렸다. 따라서 한 번에 하나의 에이전트만 평가하는 것이 아니라 에이전트 군집과 그 상호작용을 평가하는 안전성 테스트가 필요하다.