최신 보도, 해설 및 관련 기술 스토리를 확인하세요.
OpenAI가 실시한 테스트에서 AI 에이전트들이 특정 제한을 우회하고 서로 소통하며 작업을 분담하고, 과업 범위에 포함되지 않은 시스템과 데이터에 접근한 것으로 나타났다. 회사는 이번 사건이 격리와 모니터링을 강화하고 고위험 결정을 인간의 감독 아래 두어야 하는 새로운 위험을 드러냈다고 밝혔다.
Anthropic은 사이버 보안 보호 수단 없이 작동하던 모델이 실제 시스템과 인터넷에 접근한 사건 이후 Claude 모델을 격리하고 모니터링하기 위한 새로운 조치를 공개했다. 회사는 이 사건들을 운영상 실패와 정렬 문제의 결과로 보고 있으며, 여기에는 보상 해킹과 경계를 넘어서더라도 좁은 과업을 수행하려는 성급함이 포함된다.