OpenAI는 곧 제공할 예정인 인공지능 모델 Astra에 대한 새로운 세부 내용을 공개하며, 이 모델이 자사의 Preparedness Framework에서 ‘중대한 사이버 능력’ 수준에 도달한 첫 모델이라고 밝혔다. 회사의 설명에 따르면 이는 모델에 적절한 도구와 접근 권한이 제공될 경우 이전에 알려지지 않은 보안 취약점을 발견하고 이를 악용하는 방법을 개발할 수 있다는 뜻이다.
이번 발전은 모델이 코드를 분석하거나 수정 사항을 제안할 수 있는 능력에만 해당하는 것이 아니라, 악용 과정의 고도화된 단계들을 수행할 수 있는 능력과도 관련된다. 이 때문에 OpenAI는 Astra의 개발 및 출시 일부를 연기했으며, 최근 몇 주 동안 이를 악의적인 사이버 공격에 사용하거나 무단 작업을 수행할 가능성을 줄이는 작업을 진행했다.
악용 테스트에서 강력한 결과
OpenAI는 Astra가 알려진 취약점에 대한 악용 소프트웨어 개발 능력을 측정하는 테스트인 ExploitBench에서 100%의 점수를 기록했다고 밝혔다. 또한 회사는 2026년 6월부터 8월까지 발표된 20개의 고위험 취약점을 대상으로 내부 평가를 실시했다.
OpenAI가 제시한 결과에 따르면 Astra는 이 평가에서 GPT-5.6 Sol 모델보다 원격 코드 실행률이 높았으며, 사용한 토큰 수는 더 적었다. 회사는 테스트 중 모델이 악용 과정에서 ‘제로데이’ 유형의 취약점 2개를 발견하고 사용했으며, 해당 취약점과 관련된 소프트웨어 개발자들에게 통보하기 시작했다고 밝혔다.
전문가들이 수행한 다른 테스트에서는 Astra가 강화된 브라우저의 알려지지 않은 취약점을 악용한 뒤 격리 환경을 벗어나 호스트 시스템에서 명령을 실행할 수 있는지도 평가했다. 운영체제 테스트에서 모델은 OpenAI에 따르면 여러 취약점을 연결해 권한이 없는 사용자에서 root 권한으로 접근하는 데 성공했다.
제한적 제공과 추가 통제
OpenAI는 Astra의 가장 고도화된 사이버 역량을 단계적으로 제공할 계획이다. 첫 단계에서는 테스트에 참여하는 일부 사용자로 대상이 제한되며, 이후 Daybreak Blue 프로그램을 통해 방어적 사용으로 접근 범위를 확대할 예정이다.
회사는 Astra가 악의적인 사이버 요청을 거부하는 비율을 높였으며, 고위험으로 판단되는 계정에는 더 엄격한 제한을 적용할 것이라고 밝혔다. 또한 무단 행동을 감지하기 위한 모니터링 메커니즘과 함께, 모델이 수행하는 행동에 대한 추론 및 감독 계층도 추가할 예정이다.
이 소식이 중요한 이유
실질적으로 달라지는 점은 회사의 테스트에 따르면 범용 모델이 여러 단계로 구성된 과정을 통해 취약점 발견과 악용에 기여할 수 있는 수준에 도달했다는 것이다. 사용이 허가된 환경으로 제한된다면 이는 방어팀과 보안 연구자에게 도움이 될 수 있지만, 동시에 복잡한 공격을 개발하는 데 필요한 노력을 줄일 수 있는 동일한 능력 때문에 접근 통제와 모니터링의 중요성도 높아진다.
여기에는 이용 가능한 정보의 한계가 있다. 제시된 수치와 결과의 출처는 OpenAI이며, 현재까지 Astra의 보안 수준이나 오용을 줄이기 위한 조치에 대한 독립적인 검증은 없다. 또한 기사에 따르면 전체 시스템과 상세 평가 결과는 공식 출시 때까지 공개되지 않는다. 따라서 모델의 역량과 위험에 대한 실질적인 평가는 초기 성능 주장만이 아니라, 공개된 보안 체계와 제공 이후의 독립적인 테스트 결과에 좌우될 것이다.