AnthropicとOpenAIは、性能向上とモデル運用コストの削減を組み合わせ、専門用途を対象とする新モデルを発表した。これは、プログラミングや企業向け業務における経済効率とモデルの信頼性の重要性が高まる一方、高度なモデルの安全性をめぐる議論が続いている時期に行われた。
Opus 5.5は複雑なタスクに重点
AnthropicはOpus 5.5モデルを発表した。同社によると、このモデルは複雑なタスクへの対応、ソフトウェアの不具合の発見と修正、財務データの分析、業務タスクの実行を改善している。同社のテストでは、Terminal-Bench 4.0およびFrontierCode v1.1 (Main)の2つのテストにおけるエージェント型プログラミングタスクで、同モデルがGPT-6 Astraを上回ったという。
Anthropicによると、このモデルはより明確な文章を生成し、過去のモデルと比べて境界や制御を回避しようとする傾向が85%低下した。また同社は、入力100万トークンの価格を4ドル、出力100万トークンの価格を20ドルに引き下げた。Opus 5では、それぞれ5ドルと25ドルだった。
OpenAIの3段階の異なるコスト
OpenAIはGPT-6 SolとGPT-6 Lunaの2モデルを発表し、専門的な業務、プログラミング、コンピューター利用における改善を盛り込んだ。同社によると、両モデルのコストはGPT-5.6モデルの販促価格と比べて最大50%低い。
GPT-6 Solの入力100万トークンの価格は2ドルで、出力は10ドルである。一方、GPT-6 Lunaの入力100万トークンは10セント、出力100万トークンは50セントである。OpenAIによると、GPT-6 Solが犯す誤りの数は従来モデルの約半分であり、プログラミングではFable 5.1と同等の性能を、より低いコストで実現する。
改善には、コミュニケーションの明確さの向上や、指示のコンテキストを一時保存する機能のサポートも含まれる。これにより、より多くのコンテキストを再利用し、応答を高速化できる。
実際には何が変わるのか?
新たな価格設定により、開発者や企業は、反復的なタスクや呼び出し回数の多いタスクでモデルをより幅広く利用できるようになる。一方、より高性能なモデルは、プログラミング、分析、エージェント型の実行を対象としている。しかし、優位性、精度、安全性に関する提示された数値は、企業自身が実施したテストによるものであり、それだけであらゆる用途や環境における一般的な優位性を証明するものではない。
安全性の改善と提供状況
OpenAIによると、GPT-6モデルは、プログラミングタスクの結果について不正確な情報を提示する傾向が低下し、安全でない指示を受けた際に保護措置を回避しようとする試みに対する拒否も増えている。両社は、外部の評価機関がモデルの進展と安全性を測定するために利用できる基準の提案に取り組んでいるが、これらの提案が統一基準になるかどうかはまだ明らかではない。
Opus 5.5はClaudeで利用できるほか、Amazon Web Services、Google Cloud、Microsoft Azureでも利用できる。GPT-6 SolとGPT-6 Lunaは、Plus、Pro、Business、Enterpriseプランの顧客向けに、ChatGPT WorkとCodexを通じて利用できる。一方、無料プランのユーザーとGoの加入者は、同社のデスクトップアプリを通じてGPT-6 Lunaのみ利用できる。