OpenAIはGPT-6.1 Solを発表した。これはGPT-6 Solの改良版で、高い性能と低い運用コストを組み合わせたタスクを対象としている。同社によると、このモデルはプログラミング、コンピューター操作、文書分析、プロフェッショナル向けの複数段階のワークフローでGPT-6 Astraに近い性能を示す一方、標準価格はAstraの約5分の1となる。
大規模利用を想定した価格設定
GPT-6.1 Sol APIの料金は、入力100万トークンあたり2ドル、出力100万トークンあたり10ドル。キャッシュされたトークンは100万トークンあたり0.10ドルで、OpenAIによれば標準入力料金から95%の割引となる。これにより、このモデルは同じコンテキストを繰り返しのリクエストで再利用するエージェント型アプリケーションに特に適している。
実用テストの結果
実際のコードベースを対象に長時間のソフトウェアエンジニアリング作業を測定するDeepSWE v1.1テストで、GPT-6.1 SolはGPT-6 Astraと同じ結果を、約5分の1のコストで達成した。プロフェッショナル文書分析を測定するGDP.pdfテストでは、金融、医療、法律などの分野における表、図、PDFファイルを含むタスクで、Astraに近い性能を示した。
複数段階のワークフローを測定するAutomationBenchテストでは、中程度の推論レベルにおいて、Opus 5.5を2.2ポイント、GPT-6 Solを4.8ポイント上回った。一方、コンピューター操作を測定するOSWorld 2.0テストではAstraを2.1ポイント下回ったが、1タスクあたりのコストはAstraの約7分の1で、記載された設定ではGPT-6 Solの半分未満だった。
データ分析、シミュレーション、定理証明を測定するTerminal-Bench Science 0.1では、1タスクあたりの平均コストは5.47ドルだった。Opus 5.5は23.21ドル、GPT-6 Astraは23.80ドルだった。ただし、テストで最高の性能を維持したのはAstraで、結果は68.1%だった。
正確性と安全上の制約
GPT-6.1 Solは、最高推論レベルにおける事実誤り率を4.1%に引き下げた。GPT-6 Solは4.5%、GPT-6 Astraは4%だった。OpenAIは、この評価が誤りを生じる可能性の高い難しいプロンプトに基づいており、通常のChatGPT利用を表すものではないと注意喚起している。
同社はまた、動作しないツールをユーザーに報告すること、許可されていない結果を避けること、明示的な制約を守ることについてもモデルが改善されたと述べている。さらに、GPT-6 AstraやGPT-6 Solと同様に、自動セキュリティ制御を回避しようとはしなかったと説明した。ただし、情報源はこれらの主張を検証する方法について独立した詳細を示していない。
実際には何が変わるのか
OpenAIはGPT-6.1 Solを、あらゆるテストで可能な限り高い結果を得ることよりも、トークンコストの削減が重要になる大規模アプリケーション向けの選択肢として提供している。これはソフトウェアエージェント、文書分析サービス、自動化の開発者にとって重要だが、結果の差はタスクの種類や推論レベルに左右されるため、低コストであることがAstraの全面的な代替を意味するわけではない。
このモデルは、Plus、Pro、Business、Enterprise、Eduの加入者がChatGPT WorkとCodexを通じて利用できる。また、開発者はOpenAI APIでgpt-6.1-solという名称を使って利用できる。標準のChatGPTチャットインターフェースにはまだ提供されていない。OpenAIはさらにGPT-6.1 Sol UltrafastとGPT-6 Astra Ultrafastも発表し、Astraの最大8倍の速度を主張している。一方、今週の提供開始が予想されていたGPT-6.1 Astraはまだ公開しておらず、内部テストでの安全上の懸念に関する報道が出ている。