人工知能

Microsoft、OpenAIモデルではなくQwenを基盤にした意思決定モデルをFoundryで発表

Microsoftは、アプリケーション、エージェント、ワークフローで意思決定を行うためのMicrosoft-Decision-1モデルを発表した。AlibabaのQwen3.5-9Bを基に訓練されたこのモデルは、入力100万トークン当たり0.042ドル、出力は無料で利用できるが、現時点では画像とオープンウェイトには対応していない。

2026-10-10
1 分で読めます
5 閲覧数
certi.news Editorial Team
Microsoft、OpenAIモデルではなくQwenを基盤にした意思決定モデルをFoundryで発表

MicrosoftはFoundryプラットフォームでMicrosoft-Decision-1モデルを発表した。OpenAIが開発者向けにDecisions APIのパブリックプレビュー版を提供してから、わずか3日後のことだった。両社の接近を示すようにも見えるが、Microsoftのモデルは当初、AlibabaのQwen3.5-9Bを基に訓練された。同社は後に自社のMAIモデルとOpenAIのモデルを基盤として再構築する意向も明らかにしている。

このモデルは、既存のアプリケーション、エージェント、ワークフローに意思決定能力を追加することを目的としている。たとえば、出力の評価、適切なモデルの選択、自動化されたプロセスにおける次のステップの決定などに利用できる。MicrosoftはFoundry内で、入力100万トークン当たり0.042ドルで提供しており、出力トークンは無料である。これはTypeSafeがJevモデルに課している価格と同じだ。

Microsoft社内でのテスト

Microsoftによると、このモデルの最初のユーザーは同社自身だった。Xbox Researchはプレイヤーのフィードバックに関する1万件を超える項目の順位付けに利用し、Copilotチームは会話とエージェントの応答の評価に利用した。また、オンコールのエンジニアは、稼働中のインシデントでコンテキストを抽出するために使用した。Microsoft Discoveryは、エージェントがタスクを再計画する前の実験の評価にも利用した。

同社の数値によると、Xbox関連のテストでDecision-1はGPT-6 Solより14倍以上高速で、Discoveryのテストでは一貫性が46倍高かった。記事ではこれらの比較の方法論の詳細が示されていないため、これらの数値を、そうしたシナリオ以外でのモデル性能に関する一般的な判断とみなすことはできない。

なぜこのニュースが重要なのか

意思決定モデルは、低コストな制御層として、アプリケーションとより大規模な生成モデルの間で機能する方向に進んでいる。エージェントがモデル、ツール、実行経路を何度も選択する必要がある場合、この層は重要になる。生成リクエストに伴う処理が増えると、各意思決定のコストが積み重なる可能性があるためだ。

Microsoftには、こうした種類のモデルを社内で開発する追加の動機がある。特にGitHub Copilotが、一部のタスクをデバイス上で実行するか、クラウドモデルに送信するかを判断する計画を進めているためだ。ただし、Decision-1が実際にCopilotの意思決定に関与するかどうか、また何がクラウドに送信されるのかについて、同社は確認していない。

互換性とメディアに関する制約

Foundryの一覧によると、Decision-1は最大32,768個のテキストトークンを入力として受け取り、結果をJSON形式で返すが、画像には対応していない。このため、視覚エンコーダーを使用するCloudflareのClefやOpenAIのDecisions APIよりも、対応範囲は狭い。

Microsoftはモデルの重みを公開するとも発表していない。一方、CloudflareはClefモデルをApache 2.0ライセンスでリリースした。AWS、Upstage、Ollamaは、この分野で共通インターフェースとしてTypeSafeのSystem Oneインターフェースを採用しているが、MicrosoftはDecision-1がこれに完全対応しているとは確認していない。ただし、Foundryのコード例では、/systemoneという名前のエンドポイントを呼び出している。

信頼性は欺瞞への耐性を意味しない

Microsoftによると、モデルの確率は校正されている。つまり、90%の確率を持つ予測は、代表的なケースにおいて10回中およそ9回正しいはずだということだ。ただし、同社は顧客に対し、自社のデータを使って校正を検証するよう推奨している。

JevOutの研究は、この留保が重要である理由を示している。短く自然な表現の追加によって、Jevモデルが当初正しく判断していた508件のうち312件の判断が覆された。また、229件では、モデルが誤った回答に少なくとも70%の確率を付与した。Microsoftによる自社モデルのテストでは、選択肢の順序変更や説明の言い換えなど、8種類の変更を対象とし、平均で回答の1.3%が変化した。ただし、JevOutの研究ではDecision-1はテストされていないため、この結果から、欺瞞を目的に設計された入力に対して同モデルがどのように対応するかは証明できない。

ニュースの出典
The New Stack - Software Development
原文を開く ↗
c
著者

certi.news Editorial Team

同じカテゴリー

おすすめ記事

すべてのニュースを見る