Reflection AIは、同社初のオープンウェイトAIモデルとなるBeamを発表した。コーディング、推論、AIエージェントが実行するタスクに明確な重点を置いている。モデルはスパース・Mixture-of-Experts(Sparse Mixture-of-Experts)アーキテクチャを採用し、総パラメータ数は5010億に上るが、各トークンの処理時にアクティブになるのはそのうち230億 בלבדである。
同社によると、Beamはウェブコンテンツと、ライセンスされた独自データセットから取得した23.8兆トークンで事前学習された。また、100万トークンのコンテキストウィンドウを提供し、長大な文書やタスクへの対応を想定している。事前学習に加え、Reflection AIはモデルの性能向上のため、大規模な強化学習も用いた。
集中的な学習と推論コストへの注力
強化学習の段階で同社は、Nvidia GB300 GPUを1万500台、4週間にわたって稼働させ、1億回を超えるロールアウトを生成した。学習と評価に使用されたサンドボックスの実行回数は約13億回に達した。
Reflection AIは、Beamに関する説明の中心に推論効率を据えている。同社のテストによると、高度な推論ベンチマークにおいて、BeamはZ.aiのGLM-5.2に近い性能を示しながら、推論時に使用する計算能力は3~4分の1となる。ただし、これらの結果はまだ独立した検証を受けておらず、同社も、Kimi K3などのより大型のオープンモデルが、一部のケースでは生の性能でBeamを上回ると認めている。
コーディング結果と推論努力の制御
Reflection AIによると、BeamはSWE Bench Pro v2-Hardで77.2ポイント、Terminal Bench v2.1で80.1ポイント、SWE Bench Verifiedで80.9ポイントを記録した。同社は、モデルがGLM-5.2と競合し、一部のタスクではより大型のQwenモデルに迫るとしているが、すべてのテストで競合モデルを上回るとは主張していない。
Beamにはreasoning effortパラメータが含まれており、ユーザーは推論に割り当てる計算時間を指定できる。低いレベルでは、より低コストで短い回答が生成される一方、高いレベルでは、複雑なタスクを処理するためにモデルがより多くのトークンを使用できる。
実際には何が変わるのか?
この設計は、Beamの価値がモデルの規模や最高のベンチマーク結果だけで決まるのではなく、回答の品質と、その生成に使用するリソースとのバランスにも左右されることを意味する。これは、コーディングタスクや、モデルを繰り返し呼び出すエージェントを運用する開発者や組織にとって有用となる可能性がある。ただし、実際の利点は、独立した結果、インフラのコスト、ウェイトとツールの提供条件に左右され続ける。
Beamはテキスト専用モデルであり、マルチモーダルモデルではない。ツールの利用機能とウェブアクセスを与えることで、さまざまな情報源を検索し、外部ツールが提供する情報を活用できる。Reflection AIによると、モデルは学習中に他の言語モデルを使用し、ウェブへのアクセスが提供された際には文書を読むためにOCR APIを利用することを学習した。
提供状況とより広範な戦略
同社は企業、開発者、政府機関を対象としており、Beamを日常的なワークロードで利用可能な実用モデルと位置付けている。この計画は、Reflection AIが「AIファクトリー」と呼ぶものを構築する方針の一環であり、組織が自社のデータ上で動作するシステムをカスタマイズし、ローカルで運用できるようにすることを目指している。
Reflection AIは2024年に、Google DeepMindの元研究者らによって設立された。同社はNvidia、Sequoia Capital、Lightspeed Venture Partnersの参加を含め、約47億ドルの投資を調達している。直近の資金調達ラウンドにおける同社のプレマネー評価額は約250億ドルだった。同社は、安全性テストと最終評価を完了した後、10月中にBeamのウェイト、技術報告書、モデルカード、開発者向けツールを公開する予定である。