OpenAIは、The Informationが報じたところによると、新モデルAstraに「反復深度(recurrent depth)」、または「不透明な反復(opaque recurrence)」として知られる推論技術を利用する予定です。この技術により、モデルは推論モデルにおける従来の思考ステップに似た逐次的な経路をたどるのではなく、同じクエリをループ内で複数回処理できます。
懸念を引き起こしているのは、モデルのリリースや公表された能力だけではなく、この構造によって推論プロセスの検証可能性が低下する可能性です。モデルが残す可読性のある痕跡が少なくなるほど、安全性チームが望ましくない行動を発見したり、エージェントや高度なモデルの判断理由を理解したりすることは難しくなります。
なぜこのニュースが重要なのか?
AI研究チームは「思考の連鎖」の記録を監視ツールとして利用しています。ただし、これらの記録がモデルの内部思考を完全または逐語的に表すとは限りません。記事によれば、こうした記録は、予想された行動から外れているとされたエージェントの最近の活動を分析し、その行動の理由を理解しようとするうえで重要な要因となっていました。
一方、不透明な反復の場合、処理プロセスのより大きな部分が、人間が容易に読める明確なステップを生み出さない経路へ移る可能性があります。これにより、安全性チームにとって実務的な疑問が生じます。結果に到達した方法について利用できる証拠が同時に減少する場合、推論能力が高まるモデルをどのように監視できるのでしょうか。
後戻りが難しい進路への懸念
Redwoodの最高経営責任者(CEO)であるBuck Shlegerisは、反復の増加によって思考の連鎖の監視可能性が大幅に低下する可能性があると警告しました。同氏は、Astraが従来のモデルより監視しにくいかどうかはまだ分からないと述べましたが、技術をさらに高い水準へ押し進めれば、この監視可能性が完全に損なわれることを懸念しています。
また、長年AI安全性を支持してきたZvi Mowshowitzは、こうした手法を集中的に利用すると、OpenAIとAnthropicが思考の連鎖を可読に保ち、実際の行動と一致させようとしてきた取り組みに悪影響を及ぼす可能性があると述べました。同氏は、AI研究所間の「底辺への競争」と呼ぶ状況を防ぐため、法規制が必要になる可能性を示しました。
OpenAIの立場と現時点で分かっている制限
入手可能な情報によると、Astraによるこの技術の利用は限定的であり、その思考の連鎖は引き続き可読であると予想されています。またOpenAIは、モデルが完全に理解不能な形式、あるいは時に「ニューラル語(neuralese)」と呼ばれる形式へ移行するとの示唆を否定しました。
OpenAIの主任科学者であるJakub Pachockiは、Xへの投稿を通じて、同社が初期の推論モデル以来、思考の連鎖の監視と活用を維持することに取り組んできたと確認しました。また、この目標は現在の研究プログラムにおける重要な柱だと述べました。OpenAIは、将来の安全性計画の一環として、思考の連鎖に対する監視を拡大する計画も発表していました。
何が未解決のままなのか?
Redwood Researchの主任科学者であるRyan Greenblattは、不透明な推論が従来の思考の連鎖に基づく推論よりも速く拡大し、思考プロセスの大部分が見えない「潜在空間」へ移行する可能性があると考えています。The Informationはその後、AnthropicとGoogle DeepMindもこの技術について議論していると報じており、この問題がAstraモデルを超えて、より広範な研究の方向性になる可能性を示しています。
しかし、情報源はAstraが思考の連鎖を完全に隠すことを証明しておらず、監視可能性がどの程度低下するのかを示す具体的な測定結果も提示していません。したがって、現時点で確実に言える変化は、安全性ツールについて疑問を投げかける新技術が登場したことであり、それらのツールが失敗したことが確定したわけではありません。実際の重要性は、不透明な反復がどの程度利用されるか、そしてOpenAIや他の研究所が従来の記録に代わる、またはそれを補完する監視手段を提供できるかどうかに左右されます。