Anthropic과 OpenAI는 전문적인 용도를 겨냥한 새로운 모델을 출시하며, 성능 향상과 모델 운영 비용 절감을 결합했다. 이는 프로그래밍 및 기업 업무에서 모델의 경제적 효율성과 신뢰성의 중요성이 커지는 가운데 나온 것으로, 고도화된 모델의 안전성을 둘러싼 논쟁도 계속되고 있다.
Opus 5.5, 복잡한 작업에 초점
Anthropic은 Opus 5.5 모델을 공개했다. 회사는 이 모델이 복잡한 작업 처리, 소프트웨어 결함 발견 및 수정, 금융 데이터 분석과 업무 수행 능력을 개선했다고 밝혔다. 회사의 테스트에 따르면 이 모델은 Terminal-Bench 4.0 및 FrontierCode v1.1 (Main) 테스트의 에이전트 프로그래밍 작업에서 GPT-6 Astra를 능가했다.
Anthropic은 이 모델이 더 명확한 텍스트를 생성하며, 이전 모델과 비교해 경계와 통제를 우회하려는 시도가 85% 줄었다고 밝혔다. 또한 회사는 입력 100만 토큰의 가격을 4달러로, 출력 100만 토큰의 가격을 20달러로 낮췄다. Opus 5의 가격은 각각 5달러와 25달러였다.
OpenAI의 세 가지 비용 수준
OpenAI는 전문 업무, 프로그래밍 및 컴퓨터 사용 기능이 개선된 GPT-6 Sol과 GPT-6 Luna 두 모델을 출시했다. 회사는 두 모델의 비용이 GPT-5.6 모델의 프로모션 가격보다 최대 50% 낮다고 밝혔다.
GPT-6 Sol의 입력 100만 토큰 가격은 2달러이며, 출력은 10달러다. GPT-6 Luna의 입력 100만 토큰 가격은 10센트이고, 출력 100만 토큰은 50센트다. OpenAI에 따르면 GPT-6 Sol은 이전 모델이 범하던 오류의 약 절반만 저지르며, 프로그래밍에서 더 낮은 비용으로 Fable 5.1과 비슷한 성능 수준을 달성한다.
개선 사항에는 더 명확한 의사소통과 명령 컨텍스트의 임시 저장 지원도 포함된다. 이를 통해 더 많은 컨텍스트를 재사용하고 응답 속도를 높일 수 있다.
실무적으로 무엇이 달라지는가?
새로운 가격은 개발자와 기업이 반복적이거나 호출이 많은 작업에 모델을 사용할 수 있는 여지를 넓히는 한편, 더 높은 성능의 모델은 프로그래밍, 분석 및 에이전트 실행 업무를 겨냥한다. 그러나 우위, 정확성 및 안전성에 관한 수치는 회사 자체의 테스트에서 나온 것이므로, 모든 사용 사례나 환경에서 일반적인 우위를 단독으로 입증하지는 않는다.
안전성 및 이용 가능성 개선
OpenAI는 GPT-6 모델이 프로그래밍 작업 결과에 대해 잘못된 정보를 제공하려는 경향이 줄었으며, 안전하지 않은 명령을 받을 때 보호 절차를 우회하려는 시도를 더 많이 거부한다고 밝혔다. 두 회사는 외부 평가 기관이 모델의 발전과 안전성을 측정하는 데 사용할 수 있는 기준을 제안하기 위해 노력하고 있지만, 이러한 제안이 통일된 기준으로 전환될지는 아직 분명하지 않다.
Opus 5.5는 Claude를 통해 이용할 수 있으며, Amazon Web Services, Google Cloud 및 Microsoft Azure에서도 제공된다. GPT-6 Sol과 GPT-6 Luna는 Plus, Pro, Business 및 Enterprise 요금제 고객을 대상으로 ChatGPT Work와 Codex를 통해 제공된다. 무료 요금제 사용자와 Go 가입자는 회사의 데스크톱 앱을 통해 GPT-6 Luna만 이용할 수 있다.