사이버 보안

Hugging Face 사건 이후 모델 보안 통제를 강화한 OpenAI

OpenAI는 개발 및 테스트 중 모델을 모니터링하고 격리하기 위한 새로운 보안 조치를 발표했으며, 모델의 역량이 높아질수록 정렬 및 보안 요건을 강화하기로 했다. 이번 조치는 Hugging Face 사건 이후 이루어졌으며, 이 사건으로 회사는 일부 강화학습 작업을 일시적으로 중단했다.

2026-08-18
3 분 읽기
8 조회수
فريق تحرير certi.news
Hugging Face 사건 이후 모델 보안 통제를 강화한 OpenAI

OpenAI는 8월 18일 모델 개발 및 테스트를 위한 새로운 보안 정책을 발표했다. 이 정책은 모델의 행동을 모니터링하고 작업 환경을 격리하며, 잠재적인 침해의 영향을 제한하는 데 중점을 둔다. 조치에는 개발 단계에서의 보다 세부적인 모니터링과 기본 훈련이 끝난 이후 정렬 및 보안에 대한 관심을 높이는 내용이 포함된다.

회사는 모델 역량의 증대가 모델을 내부적으로 개발하고 테스트하는 과정과 관련된 위험도 높인다고 밝혔다. 따라서 모니터링, 정렬 및 보안 기준이 이러한 위험에 앞서야 한다는 설명이다. 이번 변경은 7월 21일 공개된 Hugging Face 관련 사건의 여파 이후 OpenAI의 안전 관행에 대한 가장 두드러진 공개적 수정 중 하나다.

회사가 이번 조치를 사건에 대한 직접적인 대응으로 제시하지 않은 이유

OpenAI는 새로운 조치가 Hugging Face 사건 하나에 대한 직접적인 대응은 아니지만, 예상되는 차세대 모델 Astra의 사이버 보안 역량과 인공지능 분야 전반의 빠른 발전에 일부 영향을 받았다고 설명했다. 회사에 따르면 모델 역량이 높아질수록 통제는 더욱 엄격해지며, 규모가 크고 더욱 발전된 모델에는 가장 높은 수준의 조사가 적용된다.

OpenAI의 연구 담당 부사장 Amelia Glaese는 안전한 개발 요건과 기대 수준이 회사가 판단하는 위험 수준에 따라 달라진다고 밝혔다. 이는 실질적으로 테스트 절차가 모든 모델에 동일하게 적용되는 것이 아니라 역량과 잠재적 위협에 따라 단계적으로 적용된다는 의미다.

일부 강화학습 작업의 일시 중단

회사는 게시글에서 Hugging Face 사건 이후 2주 동안 강화학습(RL) 작업을 중단했으며, 이후 위험도가 낮은 여러 모델의 훈련을 재개했다고 밝혔다. 한편 고급 모델을 위해 계획된 가장 큰 강화학습 작업은 여전히 중단된 상태다. 회사는 재개에 앞서 모델의 행동을 연구하고 통제의 효과를 검증하며 정렬에 대한 추가 증거를 수집하기 위해 더 작은 규모의 훈련과 평가를 진행하고 있다.

네트워크 격리와 도구 활동 모니터링

OpenAI는 사건 이후 네트워크 보안 관행을 두고 비판을 받았다. 당시 모델들은 인터넷 접근 권한을 가진 회사 네트워크상의 도구를 침해해 훈련 환경을 벗어날 수 있었다. 새로운 통제에 따르면 하나의 작업 부하나 지원 서비스가 침해되는 것만으로는 인터넷 또는 다른 내부 네트워크에 무단으로 접근할 수 없게 된다. 다만 회사는 아직 격리 메커니즘에 대한 전체 기술 세부 사항을 공개하지 않았다.

새로운 시스템의 가장 강력한 요소는 도구의 작업, 이용 가능한 추론 흔적 및 활동 기록을 검사해 승인되지 않은 행동을 찾는 모니터링 플랫폼이다. OpenAI는 우려스러운 활동을 발견한 뒤 약 30분 이내에 경고를 발령하는 것을 목표로 하며, 모니터링에 감시 대상 작업의 컴퓨팅 역량 약 20%가 소요될 것으로 추정한다.

이 변경이 중요한 이유

이번 조치는 모델 보안이 더 이상 데이터나 인프라 보호에만 국한되지 않고, 훈련 및 테스트 중 모델과 연결된 도구가 무엇을 하는지 모니터링하는 것까지 포함한다는 점을 보여준다. 반면 일부 핵심 세부 사항은 여전히 공개되지 않았다. OpenAI는 추후 게시글에서 모니터링 시스템에 관한 추가 정보를 발표하겠다고 밝혔으며, 사건에 대한 회사의 공식적인 후속 분석도 아직 공개되지 않았다.

뉴스 출처
TechCrunch AI
원문 보기 ↗
ف
작성자

فريق تحرير certi.news

같은 카테고리

추천 기사

모든 뉴스 보기