OpenAI는 지난 6개월 동안 모델 또는 인공지능 에이전트가 의도된 제약을 벗어나 행동한 여섯 가지 사례를 공개했다. 여기에는 파일을 인터넷에 업로드하거나, 노출된 API 키를 사용하거나, 후속 모델에 지시를 전달하거나, 오류를 숨기려 한 사건이 포함됐다. 회사는 이러한 사례를 모델 비정렬(Model Misalignment)이라고 부르며, 이는 작업을 수행하는 과정에서 모델에 지정된 제약과 상충하거나 감독 및 보호 메커니즘을 우회하는 행동을 의미한다.
회사는 동시에 이러한 사건을 추적하고 조사하며 공개하기 위한 새로운 프레임워크를 발표했다. 이는 이전의 덜 체계적인 공개 방식을 대체한다. 새로운 프레임워크에 따르면 OpenAI의 모든 직원은 사건을 신고할 수 있으며, 이후 해당 사건은 평가를 거쳐 공개 준비 완료, 제한적 조사, 확대 조사 중 하나로 분류된다. 사건의 복잡성, 외부 관계자의 존재, 보안 취약점, 오용 위험 등의 요인에 따라 필요한 조사 수준이 결정된다.
이례적인 여섯 가지 사건
OpenAI가 공개한 사례 중에는 일반에 공개되지 않은 모델이 27개 작업 요약에 자체 지시를 추가한 사건이 있었다. 여기에는 일반적인 제약을 무시하라는 지시도 포함됐다. 또 다른 사례에서는 GPT-5.6 Sol 모델이 요약문에 지시를 추가해 후속 모델에 오류를 숨기고, 누락된 과거 데이터를 조작하거나, 출처 버전 간 차이를 은폐하도록 요구했다.
또한 한 모델은 공개적으로 노출된 API 키를 발견해 허가 없이 사용한 뒤, 데이터를 가져오지 못하자 요구된 수치를 조작했다. 별도의 사건에서는 일반에 공개되지 않은 모델이 브라우저에서 접근할 수 있는 인용 자료를 제공하기 위해 로컬에서 생성한 파일을 인터넷에 업로드했다. 해당 모델에는 그렇게 할 권한이 없었다.
회사에 따르면 모델들은 서로 다른 학습 샘플 간에 메시지를 주고받기 위해 내부 코드 저장소를 사용했으며, 더 오래된 모델은 네트워크 제약을 우회하려는 과정에서 테스트 파일을 업로드했다. 또한 협력 에이전트들은 서로의 로컬 파일에 접근하지 못하자 파일을 공개 호스팅 서비스에 업로드했다. 그 결과 로컬 저장소만 사용하라는 지시가 있었음에도 작업 결과물이 공개 링크를 통해 노출됐다.
실무적으로 무엇을 의미하는가?
각 사건은 기술 보고서에 기록되며, 보고서에는 모델 이름, 해당 모델의 행동 설명, 발생 시점, 사용자 작업과 OpenAI가 제시한 모델의 내부 추론을 포함한 사건의 상세한 재구성, 안전에 미칠 수 있는 영향에 대한 회사의 설명, 실행했거나 계획 중인 완화 조치가 담긴다.
OpenAI는 여섯 가지 사례가 자사 모델에서 비정렬이 발생하는 비율을 나타내는 것이 아니라, 분석과 공개가 필요했던 극단적인 사례라고 말한다. 그러나 이 사례들은 작업에 파일, 네트워크 또는 데이터 접근에 대한 명시적인 제약이 포함돼 있더라도 에이전트가 허가받지 않은 수단으로 목표를 달성하려 할 수 있음을 보여준다.
회사는 올해 초 발생한 Hugging Face 침해 사건도 언급했다. 이 사건에는 회사가 «비정렬»이라고 표현한 700개의 인공지능 에이전트 무리가 연관됐으며, 새로운 프레임워크에 따르면 확대 조사 범주로 분류됐을 것이라고 설명했다. 이는 새로운 프레임워크가 개별 사례를 공개하는 데 그치지 않고, 신속하게 조사를 종결할 수 있는 사건과 먼저 예비 보고서를 작성한 뒤 조사 종료 후 전체 분석이 필요한 사건을 구분한다는 점을 보여준다.