SpaceXAI는 현지 시간 9월 21일 인공지능 모델 Grok 4.7을 공개했다. 회사는 이 모델을 기업과 개발자를 위한 자사의 가장 강력한 프로그래밍 및 지식 업무 전용 모델이라고 소개했다. 이 모델은 Grok 4.6과 동일한 가격과 속도로 제공되며, 회사는 같은 등급의 모델과 비교해 두 배 빠르고 비용은 절반이라고 밝혔다.
Grok 4.7에서 무엇이 바뀌었나?
이 모델은 더 큰 기본 모델을 기반으로 하며, 완료하는 데 수 시간이 걸릴 수 있는 문제를 처리하도록 설계된 복합 작업과 더 긴 강화학습 훈련을 적용했다. SpaceXAI에 따르면 이를 통해 모델의 작업 검토 능력과 긴 컨텍스트 처리 능력이 향상됐다. 또한 회사의 프로그래밍 에이전트인 Grok Bot의 작동 방식을 본질적으로 이해하도록 훈련해 대화형 작업과 일반적인 지식 업무에서의 성능 향상을 목표로 했다.
개선 사항에는 문서와 프레젠테이션 작성뿐 아니라 변호사, 간호사, 금융 분석가의 업무를 모방하는 전문 작업 수행 능력도 포함된다. GDPval 테스트에서 Grok 4.7은 Elo 점수 1695점을 기록해 1605점의 Grok 4.6과 1542점의 GPT-6 Astra를 앞섰지만, 1735점을 기록한 Fable 5.1에는 뒤처졌다.
일부 테스트에서는 앞섰지만 모든 테스트에서는 그렇지 않아
장기 프로그래밍 작업을 평가하는 CursorBench 4.0에서 Grok 4.7은 46.3%를 기록했다. Grok 4.6은 40.4%, GPT-5.6 Sol은 41.7%였으며, Fable 5.1이 51.8%로 가장 높은 결과를 기록했다. 또한 이 모델은 전기공학 평가인 EEBench에서 64.0%, 법률 작업 평가인 Harvey Legal Agent Benchmark에서 19.6%를 기록해 비교 대상 모델 가운데 가장 높은 점수를 얻었다.
그러나 우위가 모든 영역에서 나타난 것은 아니다. 장기 터미널 작업을 평가하는 Terminal-Bench 4.0에서 Grok 4.7은 38.0%를 기록해 57.9%의 Fable 5.1에 뒤처졌다. 임상 추론 평가인 HealthBench Professional에서는 56.7%로, 60.5%의 GPT-5.6 Sol과 62.1%의 Fable 5.1보다 낮았다. 이러한 결과는 모델 선택이 종합 순위나 가격만이 아니라 작업 유형과도 연관될 것임을 의미한다.
가격 및 이용 가능 여부
Grok API의 가격은 입력 100만 토큰당 2달러, 출력 100만 토큰당 6달러부터 시작한다. 비교하면 GPT-5.6 Sol은 입력 100만 토큰당 4달러, 출력 100만 토큰당 20달러이며, Fable 5.1은 입력 100만 토큰당 10달러, 출력 100만 토큰당 50달러다. SpaceXAI는 기본 버전보다 속도가 두 배 빠른 버전도 제공하며, 가격 역시 두 배로 책정했다.
Grok 4.7은 같은 날 Cursor와 프로그래밍 도구 Grok Build를 통해 이용할 수 있게 됐으며, Grok API와 제3자 프로그래밍 도구, 모델 라우터 및 클라우드 컴퓨팅 플랫폼에서도 제공된다.
안전성과 테스트 도구 접근
SpaceXAI는 보호 메커니즘을 전면 재설계했으며, 제한을 우회하려는 시도에 대한 저항성과 위험한 요청 거부 능력을 개선했다고 밝혔다. 이 모델은 생물학 분야의 안전성 평가인 LatchBio 테스트에서 62.4%를 기록해 회사가 비교한 모델 가운데 가장 높은 결과를 얻었다. HackerBench v0.3에서는 이중 용도 요청과 사이버 위험이 포함된 요청의 3.3%만 통과했으며, 회사는 합법적인 보안 작업의 대부분을 차단하지 않는다고 밝혔다.
SpaceXAI는 또한 일부 사이버보안 파트너에게 방어 연구를 목적으로 한 레드팀 기능에 초대 방식으로 접근할 수 있도록 제공하기 시작했다. 이러한 주장은 회사가 선택한 테스트와 방법론에 연관되어 있으며, 분야별 결과의 편차는 개발 및 비즈니스 팀이 실제 사용 사례에 따라 모델을 평가해야 함을 보여준다.