OpenAI는 GPT-6 Sol의 개선 버전인 GPT-6.1 Sol을 발표했다. 이 모델은 높은 성능과 낮은 운영 비용을 결합한 작업을 대상으로 한다. 회사는 이 모델이 프로그래밍, 컴퓨터 사용, 문서 분석 및 전문적인 다단계 워크플로에서 GPT-6 Astra에 근접한 성능을 보이며, 표준 가격은 Astra 가격의 약 5분의 1이라고 밝혔다.
대규모 사용을 고려한 가격 책정
GPT-6.1 Sol API의 비용은 입력 토큰 100만 개당 2달러, 출력 토큰 100만 개당 10달러다. 캐시된 토큰은 100만 개당 0.10달러로, OpenAI에 따르면 표준 입력 가격보다 95% 할인된 금액이다. 이에 따라 이 모델은 반복적인 요청에서 동일한 컨텍스트를 재사용하는 에이전트 애플리케이션에 특히 적합하다.
실제 테스트 결과
실제 코드베이스를 대상으로 장시간 소프트웨어 엔지니어링 작업을 측정하는 DeepSWE v1.1 테스트에서 GPT-6.1 Sol은 GPT-6 Astra와 동일한 결과를 기록했지만 비용은 약 5분의 1이었다. 전문 문서 분석을 위한 GDP.pdf 테스트에서는 금융, 보건, 법률 등의 분야에서 표와 도표 및 PDF 파일이 포함된 작업에서 Astra에 근접한 성능을 보였다.
다단계 워크플로를 위한 AutomationBench 테스트에서 이 모델은 중간 수준의 추론에서 Opus 5.5보다 2.2포인트, GPT-6 Sol보다 4.8포인트 앞섰다. 컴퓨터 사용을 위한 OSWorld 2.0 테스트에서는 Astra보다 2.1포인트 낮았지만, 작업당 비용은 Astra의 약 7분의 1이었고 해당 설정에서 GPT-6 Sol 비용의 절반에도 미치지 않았다.
데이터 분석, 시뮬레이션 및 정리 증명을 측정하는 Terminal-Bench Science 0.1에서 작업당 평균 비용은 5.47달러로, Opus 5.5의 23.21달러와 GPT-6 Astra의 23.80달러보다 낮았다. 그럼에도 Astra는 68.1%의 점수로 이 테스트에서 가장 높은 성능을 유지했다.
정확도와 보안상의 한계
GPT-6.1 Sol은 최고 추론 수준에서 사실 오류율을 4.1%로 낮췄다. GPT-6 Sol은 4.5%, GPT-6 Astra는 4%였다. OpenAI는 이 평가가 오류가 발생할 가능성이 높은 어려운 프롬프트를 기반으로 하며, 일반적인 ChatGPT 사용을 대표하지 않는다고 경고했다.
회사 측은 또한 이 모델이 작동하지 않는 도구를 사용자에게 알리고, 허용되지 않은 결과를 피하며, 명시적인 제약을 준수하는 능력이 향상됐다고 밝혔다. 또한 GPT-6 Astra 및 GPT-6 Sol과 마찬가지로 자동 보안 제어 장치를 우회하려 하지 않았다고 설명했다. 다만 출처는 이러한 주장에 대한 검증 방법론의 독립적인 세부 사항을 제공하지 않는다.
실제로 무엇이 달라지는가?
OpenAI는 GPT-6.1 Sol을 모든 테스트에서 가능한 최고 점수를 얻는 것보다 토큰 비용 절감이 더 중요할 수 있는 대규모 애플리케이션을 위한 선택지로 제시한다. 이는 소프트웨어 에이전트, 문서 분석 서비스 및 자동화 개발자에게 중요하지만, 결과의 차이는 작업 유형과 추론 수준에 따라 달라지므로 낮은 비용이 Astra를 전면적으로 대체한다는 의미는 아니다.
이 모델은 ChatGPT Work와 Codex를 통해 Plus, Pro, Business, Enterprise 및 Edu 가입자가 이용할 수 있으며, 개발자는 gpt-6.1-sol이라는 이름으로 OpenAI API에서 사용할 수 있다. 아직 표준 ChatGPT 대화 인터페이스에는 출시되지 않았다. OpenAI는 또한 GPT-6.1 Sol Ultrafast와 GPT-6 Astra Ultrafast를 발표하며 Astra보다 최대 8배 빠른 속도를 주장했다. 한편 이번 주 출시가 예상됐던 GPT-6.1 Astra는 아직 출시하지 않았으며, 내부 테스트에서 보안 우려가 있었다는 보고가 나왔다.