OpenAIは、近日中の提供を予定している人工知能モデルAstraについて新たな詳細を明らかにし、同社のPreparedness Frameworkにおける「重大なサイバー能力」の水準に初めて到達したモデルだと述べた。同社の説明によれば、これはモデルに適切なツールとアクセス権限を与えた場合、これまで知られていなかったセキュリティ脆弱性を発見し、それを悪用する方法を開発できることを意味する。
今回の進展は、モデルがコードを分析したり修正を提案したりできることだけに関係するものではなく、悪用チェーンの高度な段階を実行できる能力にも関わる。そのためOpenAIは、Astraの開発と提供の一部を延期し、ここ数週間、同モデルが有害なサイバー攻撃に利用されたり、許可されていない操作を実行したりする可能性を低減する取り組みを進めてきた。
悪用テストで高い成果
OpenAIによると、Astraは、既知の脆弱性に対するエクスプロイトソフトウェアの開発能力を測定するExploitBenchテストで、100%の結果を達成した。同社はまた、2026年6月から8月までの期間に公表された、重要度の高い20件の脆弱性を対象とする社内評価も実施した。
OpenAIが示した結果によれば、この評価でAstraは、GPT-5.6 Solと比べて、より少ないトークン単位数を使用しながら、リモートコード実行の成功率で上回った。テスト中、同社によると、モデルは悪用チェーンの一環として「ゼロデイ」分類の脆弱性を2件発見して利用し、同社はこれらの脆弱性に関係するソフトウェア開発者への通知を開始した。
専門家が実施した別のテストでは、強化されたブラウザーに存在する未知の脆弱性をAstraが悪用し、その後サンドボックス環境から脱出してホストシステム上でコマンドを実行できるかどうかも検証された。オペレーティングシステムのテストでは、OpenAIによれば、モデルは複数の脆弱性を組み合わせ、権限のないユーザーからroot権限へアクセスすることに成功した。
限定提供と追加の安全対策
OpenAIは、Astraの最も高度なサイバー能力を段階的に提供する計画だ。第1段階では、テストに参加するユーザーの一部に限定し、その後、Daybreak Blueプログラムを通じて防御目的の利用へアクセスを拡大する。
同社は、悪意のあるサイバー関連の依頼に対するAstraの拒否率を引き上げ、高リスクと判断したアカウントにはより厳しい制限を課すとしている。また、許可されていない行動を検出する監視メカニズムに加え、モデルが実行する行動に対する推論と監督の層も追加する。
なぜこのニュースが重要なのか?
実際に変化するのは、同社のテストによれば、一般的なモデルが、複数の段階からなるチェーンを通じて脆弱性の発見と悪用に寄与できる水準へ移行することだ。利用が許可された環境に限定されるなら、防御チームやセキュリティ研究者に利益をもたらす可能性がある。一方で、同じ能力によって複雑な攻撃の開発に必要な労力が減る可能性があるため、アクセス制御と監視の管理に対する重要性も高まる。
ここでは、利用可能な情報の限界が浮き彫りになる。提示された数値と結果の情報源はOpenAIであり、現時点ではAstraのセキュリティ水準や悪用防止策について独立した検証は存在しない。また、記事によれば、完全なシステムと評価の詳細な結果は、正式提供時まで公表されない。そのため、モデルの能力とリスクを実際に評価する際は、初期の性能主張だけでなく、公開されるセキュリティシステムと、提供開始後に行われる独立テストの結果に基づくことになる。