중국의 인공지능 스타트업 Z.ai는 2026년 8월 14일 GLM-5.3 모델을 출시했다고 발표했다. 이 모델은 장기 프로그래밍 작업에서 크게 개선됐으며 사이버 보안 역량도 더욱 두드러지게 향상됐다. Z.ai의 개발자 옹호 담당자 Lou에 따르면, 이 모델의 사이버 역량은 이미 SpaceX가 최근 인수한 인공지능 프로그래밍 기업 Cursor에서 «잠재적으로 심각한 취약점»을 발견했다. VentureBeat는 Cursor에 해당 사실에 대한 확인을 요청했으며 답변을 기다리고 있다고 밝혔다.
GLM-5.3은 처음에는 GLM Coding Plan과 Z.ai의 ZCode 환경을 통해서만 제공된다. 회사에 따르면 API와 오픈 웨이트는 «안전성 평가와 강화가 완료된 후» 제공될 예정이며, 회사는 출시 후 약 2주 뒤 웨이트를 공개할 계획이다.
후속 학습을 통한 대폭적인 개선
GLM-5.3은 GLM-5.2의 기반이 된 동일한 모델 기반을 사용하며, 매개변수 규모는 7,430억 개 수준이다. 출시를 위해 새로운 사전 학습 과정은 필요하지 않았다. 대신 Z.ai는 더 많은 환경과 다양한 작업, 강화학습을 위한 추가 컴퓨팅을 통해 후속 학습을 확대했다. Z.ai는 기술 발표에서 «GLM-5.3에서 우리가 한 일은 후속 학습을 확장한 것뿐이다»라고 밝혔다.
학습 환경은 개별 프로그래밍 연습이 아니라 전체 엔지니어링 작업을 모방한다. 에이전트는 코드베이스, 문서, 컴퓨팅 클러스터, 저장 시스템, 실험 결과를 제공받은 뒤 문제를 진단하고 시스템을 수정하며 실험을 실행하고, 결과의 정확성을 유지하면서 측정 가능한 개선을 입증해야 한다. 일부 작업은 숙련된 엔지니어의 며칠간 업무를 모방하도록 설계됐다.
Z.ai가 발표한 평가에서 GLM-5.3의 Terminal-Bench 3.0 점수는 4.6에서 28.3으로, DeepSWE v1.1 점수는 46.2에서 66.9로, AutomationBench 점수는 26.2에서 48.2로 상승했다. Agents' Last Exam CLI 점수도 23.8에서 28.5로 개선됐다.
그러나 회사가 공개한 표에서 이 모델이 모든 경쟁 모델을 앞선 것은 아니다. Terminal-Bench 3.0에서 GPT-5.6 Sol은 34.6점, Claude Fable 5는 33.7점을 기록한 반면 GLM-5.3은 28.3점을 기록했다. DeepSWE v1.1에서 이 모델은 66.9점을 기록해 GPT-5.6 Sol의 72.7점과 Fable 5의 69.7점에 뒤처졌다. Z.ai는 토큰 사용 효율성도 강조한다. 자체 Z.ai Code Bench 테스트에서 Max 설정으로 작업당 약 7만 5,000개의 출력 토큰을 사용했을 때 GLM-5.3은 34.5%를 기록했으며, 약 9만 6,000개의 토큰을 사용한 GLM-5.2는 23.4%를 기록했다. 이 결과는 회사 자체 테스트에서 나온 것으로 독립적인 측정값은 아니다.
회사의 예상을 넘어선 사이버 역량
Z.ai는 소프트웨어 취약점 발견 능력을 향상시키기 위해 후속 학습에 취약점 탐지 환경을 도입했다. 그러나 회사는 이러한 역량이 예상보다 빠르게 발전했으며, 취약점 식별을 넘어 완성된 익스플로잇 체인을 구축하는 방향으로 더 크게 확장됐다고 밝혔다.
GLM-5.3은 CyberGym에서 84.5%를 기록해 GLM-5.2의 77.2%를 웃돌았으며, Z.ai가 보고한 GPT-5.6 Sol의 83.6%와 Mythos 5의 83.8%보다도 소폭 앞섰다. ExploitBench에서는 54.4%를 기록해 GLM-5.2의 24.4%보다 두 배 이상 높았지만, GPT-5.6 Sol의 76.5%와 Mythos 5의 78%에는 뒤처졌다.
Z.ai는 중국의 보안 팀들과 협력한 결과, 검토와 심사 및 중복 제거를 거쳐 269개 프로젝트에서 2,436건의 취약점을 발견했다고 밝혔다. 회사의 공개 기록에 따르면 이 결과 중 1,097건은 고위험 또는 치명적 위험으로 분류됐으며, 이 가운데 53건은 공개됐고 2,383건은 출시 시점에 비공개 상태로 남아 있었다. Reuters는 또한 회사가 일부 고급 역량에 대한 통제를 제공하고 있으며, 민감한 기능에 «신뢰된 접근» 방식을 적용한다고 보도했다.
통합 및 제공 방식에 필요한 변경
GLM-5.3으로 전환하려면 일부 기존 애플리케이션을 수정해야 한다. 이 모델은 low, high, max의 추론 노력 수준을 지원하며, max가 프로그래밍에 권장되는 기본 설정이다. 이전 버전에서 가능했던 것처럼 사고 과정을 비활성화할 수 없으므로, thinking.type: "disabled"를 전송하는 애플리케이션은 이를 enabled로 변경하고 추론 노력 수준을 지정해야 한다. 그렇지 않으면 요청이 실패한다.
ZCode 환경은 macOS, Windows, Linux에서 사용할 수 있으며, 계획 수립, 실행, 테스트, 검증을 위한 장기 Goal 작업과 실행 중인 작업의 원격 제어를 지원한다. 표시된 프로모션 가격에 따르면 개인용 GLM Coding 요금제는 주당 1만 크레딧을 제공하는 Lite 요금제가 월 12.60달러부터 시작하며, Pro는 약 56달러, Max는 약 117.60달러다. Team Standard와 Premium 좌석은 사용자당 월 88달러와 188달러다. Z.ai는 제공된 출시 자료에서 GLM-5.3의 일반 API 가격을 발표하지 않았다.
뉴스 출처
VentureBeat Startups & Funding
원문 보기 ↗