미국 사이버보안 및 정보기관들은 6개 중국 인공지능 기업이 적어도 2024년 말부터 미국의 첨단 인공지능 모델에서 지식을 추출하는 대규모 작업을 수행했다고 밝혔다. CISA, NSA, FBI가 공동으로 발표한 경고에 따르면, 이 작업에는 Anthropic, OpenAI, Google, xAI의 모델에 전송된 수백만 건의 요청에서 생성된 수십억 개의 토큰(tokens)이 포함됐다.
경고에서 지목한 기업은 DeepSeek, Moonshot AI, Alibaba, MiniMax, StepFun, Z.AI다. 기관들은 작업의 규모와 복잡성이 중국 정부가 이를 인지하고 있음을 시사하며, 이러한 방식이 관련 기업들의 개발 전략에서 핵심적인 부분일 수 있다고 밝혔다. 공개된 자료에는 이 기업들의 답변이 포함되지 않았다. BleepingComputer는 논평을 요청하기 위해 이들 기업에 연락했다고 전했다.
모델 증류 공격이란 무엇인가?
모델 증류는 더 많이 훈련된 모델의 출력물로부터 ‘학생’ 모델이 학습하도록 하는 합법적인 기술로, 훈련 비용을 줄이고 새로운 시스템의 배포를 가속하는 것을 목표로 한다. 그러나 미국 기관들은 통제된 연구 목적의 사용과, API를 악용해 모델 소유 기업이 통제하는 환경 밖으로 모델의 지식과 추론을 추출하는 증류 공격이라고 설명한 행위를 구분한다.
CISA는 해당 작업과 연관된 기업들이 사기성 또는 공유 계정, API와 클라우드 서비스, 집계기, 그리고 ‘환승 지점’ 에이전트를 통해 요청을 분산했다고 설명했다. 이러한 경로를 통해 지리적 제한과 사용 한도, 모니터링 시스템을 우회하려는 시도가 가능했다. 또한 일부 프롬프트에는 금지된 사고 연쇄 추론을 추출하려는 시도가 포함됐으며, 자동화 시스템은 서비스 제공업체를 바꾸고 방어 조치가 적용된 뒤 응답이 저하됐는지 확인했다.
기관들은 무엇을 포착했나?
경고는 DeepSeek와 Moonshot AI를 Claude, GPT, Gemini, Grok의 여러 모델을 겨냥한 주요 주체로 분류했다. MiniMax는 Claude, Gemini, GPT 모델을 겨냥한 것으로 밝혔으며, Alibaba와 StepFun은 자사 제품을 개선하기 위해 Claude와 GPT를 겨냥한 혐의를 받았다. 또한 Z.AI는 GPT-5.5와 Claude Opus 4.8을 겨냥한 것으로 지목됐다.
기관들은 이러한 방식이 첨단 모델 개발에 필요한 시간과 비용을 줄일 수 있다고 본다. 실행 주체가 경쟁 모델을 처음부터 훈련하는 비용을 부담하는 대신 이미 준비된 모델의 출력물을 활용하기 때문이다. 이용 가능한 자료에서 이 결론은 기관들이 내린 평가이며, 독립적인 사법 판단은 아니다.
이는 모델 제공업체에 무엇을 의미하나?
CISA, NSA, FBI는 인공지능 기업들이 행동 및 인프라 수준의 탐지 수단을 개발하고, 증류 작업이 의심될 경우 응답을 조정하며, 캠페인과 관련된 정보를 관계자들과 공유할 것을 권고한다. 제안된 지표에는 새로 생성된 계정이 개설 직후 사용 한도에 도달하는 경우, 인간의 정상적인 유휴 시간이 없는 지속적인 활동, 다수의 IP 주소 또는 브라우저 식별자에서 공유 계정에 접속하는 행위, 여러 제공업체에서 동일한 프롬프트를 반복하는 행위, 접근 경로 간의 조직적인 전환 등이 포함된다.
편집자 분석: 이번 경고의 중요성은 특정 기업들을 비난하는 데만 있는 것이 아니라, 모델 보호가 더 이상 서버 침입을 차단하는 데 국한되지 않는다는 점을 보여준다는 데 있다. API에 대한 승인된 접근도 계정과 제공업체, 서로 다른 경로에 걸친 사용 패턴을 분석하지 않으면 모델 능력을 추출하는 통로로 바뀔 수 있다. 반면 이용 가능한 자료에서는 완전한 기술적 증거의 세부 사항과 기업들의 답변, 그리고 합법적인 증류와 적대적 추출 사이의 실질적인 경계가 여전히 공개된 질문으로 남아 있다.