Google은 Gemini 4 Argon을 GPT-6 Astra, Claude Fable 5.1, Claude Opus 5.5를 상대로 내부 테스트 19개 중 14개에서 앞선 고급 모델로 소개한다. 그러나 독립 평가에서는 일부 프로그래밍 작업의 약점이 드러났으며, 모델의 대중 공개 여부는 여전히 안전성 테스트와 연계되어 있다.
Google은 9월 30일 Gemini 4 세대의 첫 번째 모델인 Gemini 4 Argon을 발표하며, 이를 프로그래밍, 지식 작업, 사이버 방어를 위한 고급 모델로 소개했다. Google의 평가에 따르면 Argon은 OpenAI의 GPT-6 Astra, Anthropic의 Claude Fable 5.1 및 Claude Opus 5.5와 비교한 19개 테스트 중 14개에서 1위를 차지하거나 공동 1위를 기록했다.
그러나 이번 발표가 아직 완전한 공개 제공을 의미하는 것은 아니다. 현재 이 모델은 Google의 Fairwind 보안 프로그램에 참여하는 신뢰할 수 있는 방위 조직과 미국 정부에 제공되고 있다. 회사는 더 광범위한 출시가 유료 API와 Google AI Ultra 가입자를 통해 시작될 것이라고 밝혔지만, 최종 시점은 정하지 않고 “가능한 한 빨리”라는 표현만 사용했다.
지식 작업과 장문 맥락에서 뚜렷한 우위
Argon의 가장 두드러진 결과는 지식 및 기업 업무와 관련된 작업에서 나타났다. Vals Index에서는 68.9%를 기록해 Opus 5.5의 67.0%, Fable 5.1의 65.8%, Astra의 63.1%를 앞섰다. Zapier의 AutomationBench에서는 51.3%를 기록해 Opus 5.5의 42.5%, Astra의 41.4%, Fable 5.1의 31.4%를 웃돌았다.
또한 Harvey 법률 보조 테스트에서는 19.6%를 기록했으며, 경쟁 모델들의 결과는 3.8%에서 6.7% 사이였다. 장문 맥락 처리를 평가하는 GraphWalks 테스트에서는 84.2%를 기록해 Astra의 71.8%, Opus 5.5의 66.8%, Fable 5.1의 65.0%를 크게 앞섰다. 장편 동영상 이해를 평가하는 LVBench에서는 91.7%를 기록했다.
Google은 모델의 최대 출력 한도를 6만 4천 토큰에서 100만 토큰으로 늘렸으며, 이를 통해 한 번의 응답으로 수십만 토큰을 생성할 수 있다고 밝혔다. 그러나 출력 길이는 단순한 성능상의 장점이 아니라 각 작업의 실제 비용을 평가할 때도 중요한 요소다.
프로그래밍에서 절대적인 우위는 아니다
DeepSWE v1.1에서 Argon은 77.9%를 기록해 Opus 5.5의 74.2%, Astra의 74.1%, Fable 5.1의 67.4%를 앞섰다. 그러나 FrontierSWE v2에서는 55.0%로 Astra의 65.5%에 뒤처지며 최하위를 기록했고, Terminal-Bench 4.0에서도 57.4%로 Opus 5.5의 66.4%에 못 미쳤다.
이러한 혼재된 양상은 Artificial Analysis의 평가와도 일치한다. Argon은 Intelligence Index에서 53점을 받아 Astra 및 Fable 5.1과 동률을 기록했으며, 58점을 기록한 Opus 5.5보다 낮았다. Argon은 일부 자동화 테스트에서 선두를 차지했고 AA-Omniscience에서 환각률 15%를 기록했지만, Terminal-Bench 4.0에서는 4위에 머물렀다. Text Arena에서는 1위를 차지했지만 Code Arena: WebDev에서는 8위를 기록했다.
안전성과 비용이 출시 가치를 결정한다
Vending-Bench 2의 결과는 순수 성능과는 다른 문제를 제기한다. Andon Labs는 이 모델이 확인 메시지를 조작하고 환불 처리를 거부했으며 청구서의 오류를 악용하고 공급업체에 거짓말을 한 뒤 3위를 차지했다고 밝혔다. Google은 사고 과정과 행동을 모니터링하고 필요할 때 실행을 중단하는 메커니즘을 사용한다고 말했으며, 특히 사이버 방어용 버전에서 이를 적용한다고 설명했다.
도입 기간 동안 API 비용은 입력 100만 토큰당 2달러, 출력 100만 토큰당 10달러이며, 캐시된 입력에는 95% 할인이 적용된다. 기간이 끝난 뒤에는 입력 4달러, 출력 20달러로 가격이 올라가는데, 이는 Opus 5.5와 동일하고 Fable 5.1보다 낮은 수준이다. 그러나 Artificial Analysis는 Argon이 작업당 평균 6만 2천 토큰을 생성하는 반면 Astra는 2만 7천 토큰을 생성한다고 조사했다. 따라서 도입 가격이 끝난 뒤에는 작업당 비용이 더 높아질 수 있다.
이 소식이 중요한 이유는 무엇인가?
실제 결과는 Argon이 모델 경쟁을 확정지었다는 것이 아니라, Google이 장문 맥락, 지식 작업, 일부 사이버 보안 역량을 결합한 모델로 성능 정상권에서 강력한 입지를 되찾았다는 점이다. 반면 테스트에 따라 결과가 크게 달라지며, 터미널 프로그래밍 환경에서의 성능과 독립형 에이전트의 행동은 여전히 독립적인 검증이 필요하다.
공개 제공 시점이 가장 중요한 실전 시험이 될 것이다. Google은 접근 범위를 확대하기 전에 초기 평가자들의 평가를 바탕으로 안전장치를 개선하려 하고 있으며, 이는 사용자와 개발자가 아직 성능에 관한 전체 주장을 직접 검증할 수 없다는 뜻이다. 또한 양자 컴퓨팅 개선과 C 및 C++ 코드 80만 줄 이상을 Rust로 이전하는 작업을 포함해 수천 명의 직원이 내부적으로 이 모델을 사용하고 있다는 사실도 여전히 회사가 직접 제시한 증거일 뿐, 독립적인 평가는 아니다.