OpenAI가 The Information의 보도에 따르면 새로운 Astra 모델에 ‘반복 깊이’(recurrent depth), 또는 ‘불투명한 반복’(opaque recurrence)으로 알려진 추론 기술을 사용할 예정이다. 이 기술을 사용하면 모델은 추론 모델의 전통적인 사고 단계와 유사한 순차 경로를 따르는 대신 하나의 루프 안에서 동일한 질의를 여러 차례 처리할 수 있다.
우려를 불러일으킨 문제는 단지 모델의 출시나 공개된 능력에 관한 것이 아니라, 이러한 구조가 추론 과정을 점검하기 어렵게 만들 가능성에 관한 것이다. 모델이 남기는 읽을 수 있는 흔적이 줄어들수록 안전 팀은 원치 않는 행동을 발견하거나 에이전트와 고급 모델의 결정 이유를 이해하기 어려워진다.
왜 이 소식이 중요한가?
AI 연구팀은 ‘사고 사슬’ 기록을 모니터링 도구로 사용한다. 다만 이러한 기록이 모델의 내부 사고를 완전하거나 문자 그대로 나타내는 것은 아니다. 이 기록은 해당 기사에 따르면 예상된 행동에서 벗어난 것으로 묘사된 에이전트의 최근 활동을 분석하고 그들의 행동 이유를 이해하려는 시도에서 중요한 요소였다.
반면 불투명한 반복의 경우 처리 과정의 더 많은 부분이 사람이 쉽게 읽을 수 있는 명확한 단계를 생성하지 않는 경로로 이동할 수 있다. 이는 안전 팀에 실질적인 질문을 제기한다. 추론 능력이 높아지는 동시에 결과에 도달한 방식에 관한 이용 가능한 증거가 줄어드는 모델을 어떻게 모니터링할 수 있는가?
되돌리기 어려운 경로에 대한 우려
Redwood의 CEO인 Buck Shlegeris는 반복이 증가하면 사고 사슬의 모니터링 가능성이 크게 낮아질 수 있다고 경고했다. 그는 아직 Astra가 이전 모델보다 모니터링하기 어려운지 알지 못하지만, 기술을 더 높은 수준으로 발전시키면 이러한 가능성이 완전히 약화될 수 있다고 우려한다고 말했다.
AI 안전을 오랫동안 옹호해 온 Zvi Mowshowitz 역시 이러한 방법을 대규모로 사용하면 OpenAI와 Anthropic이 사고 사슬을 읽을 수 있고 실제 행동과 일치하도록 유지하려는 노력에 해를 끼칠 수 있다고 보았다. 그는 AI 연구소 사이의 ‘바닥을 향한 경쟁’을 막기 위해 법률이 필요할 가능성을 제기했다.
OpenAI의 입장과 현재 알려진 한계
현재 이용 가능한 정보에 따르면 Astra의 이 기술 사용은 제한적일 것이며, 사고 사슬도 계속 읽을 수 있을 것으로 예상된다. OpenAI는 또한 모델이 완전히 이해할 수 없는 방식, 또는 때때로 ‘신경 언어’(neuralese)라고 불리는 방식으로 전환할 것이라는 암시를 부인했다.
OpenAI의 수석 과학자인 Jakub Pachocki는 X에 올린 게시물을 통해 회사가 초기 추론 모델부터 사고 사슬의 모니터링 가능성을 유지하고 이를 활용하기 위해 노력해 왔으며, 이 목표가 현재 연구 프로그램의 핵심 축이라고 확인했다. OpenAI는 향후 안전 계획의 일환으로 사고 사슬에 대한 확대된 모니터링 계획도 발표한 바 있다.
무엇이 여전히 미해결 상태인가?
Redwood Research의 수석 과학자인 Ryan Greenblatt는 불투명한 추론이 전통적인 사고 사슬에 기반한 추론보다 더 빠르게 확장되어 사고 과정의 대부분을 보이지 않는 ‘잠재 공간’으로 옮길 수 있다고 본다. The Information은 이후 Anthropic과 Google DeepMind도 이 기술을 논의하고 있다고 보도했으며, 이는 이 문제가 Astra 모델을 넘어 더 광범위한 연구 방향으로 이어질 수 있음을 시사한다.
그러나 해당 출처는 Astra가 사고 사슬을 완전히 숨길 것이라는 점을 입증하지 않으며, 모니터링 가능성이 얼마나 감소하는지를 보여 주는 구체적인 측정값도 제시하지 않는다. 따라서 현재 확실한 변화는 안전 도구에 관한 질문을 불러일으키는 새로운 기술의 등장이지, 그러한 도구의 실패가 입증된 것이 아니다. 실제로 이 발전이 갖는 중요성은 불투명한 반복이 얼마나 사용되는지, 그리고 OpenAI와 다른 연구소들이 기존 기록을 대체하거나 보완할 수 있는 모니터링 수단을 제공할 수 있는지에 달려 있을 것이다.