組織が限られた数のAIエージェントを試す段階から、数十、あるいは数百のエージェントを24時間稼働させる段階へ移行すると、もはやモデルの品質だけが決定的な要因ではなくなる。Stack Overflowが公開した「Leaders of Code」対談の第2部では、Googleのアンディ・グットマンが、Stack Overflowのプラットフォームエンジニアリングマネージャーであるピーター・オコナーと、この移行の経済性について議論した。そこでは、必要なコンテキスト量、トークンのコスト、投資対効果の測定、そして組織がエージェントを実際に管理できるようにプラットフォームエンジニアリングチームが構築すべきものが扱われた。
対談の基本的な主張は、問題が単独のモデルの問題ではなく、統合されたシステム全体の問題になったということだ。最終的な性能は、モデル、その実行メカニズム、与えられるコンテキスト、カスタマイズの度合い、呼び出すツールに左右される。グットマンによれば、目標はすべてのタスクで最も高度なモデルを使うことではなく、必要な結果を最低限のコストで達成できる、最も複雑でないモデルを選ぶことだ。Gemini 3.5 Flashのような軽量モデルで十分な用途もあれば、別のケースではGemini Proモデルが必要になる。
適切なコンテキストはトークン数より重要
グットマンは、彼が「トークンの最大化」と呼ぶ考え方を批判している。入力を大きくしたり、推論ループを長くしたりしても、必ずしもより良い結果につながるわけではない。彼の説明によれば、実務上の方向性は、実際に結果を動かす情報にコンテキストを絞り、エージェントが必要とする思考サイクルを減らせるよう実行経路の精度を高めることだ。これにより、コストはモデルの価格だけでなく、検索とデータ取得の品質にも直接結び付く。
しかし、「利用可能な最小限のコンテキスト」を特定するのは単純な作業ではない。グットマンは、どのコンテキスト部分が実際に結果を改善するのかを把握するには、データとモデルを併せて評価しなければならないと述べる。そのため、コンテキストの問題を完全に解決したと主張する組織には懐疑的な姿勢を示し、Google自身も完全には解決していないと強調した。Googleは、評価、エージェントの実行経路の追跡、検索の改善、データの充実化に依存し、各タスクに何を含める価値があるのかを判断している。
この点はAIチームにとって重要だ。なぜなら、整理された知識やデータスキーマを、それ自体が目的であるかのように扱うことを戒めるからだ。人間がある情報を有用だと考えていることは、それがエージェントにとってより良い結果をもたらす証明にはならない。測定は実際の出力と実行経路から始めるべきであり、意思決定権限や人間による判断が必要な場合には、人間をループ内に残しておく必要がある。
規模がコストと投資対効果の構造を変える
従来の職場環境では、従業員数と勤務時間から利用規模をおおよそ見積もることができる。しかしエージェントはより高速に、しかも24時間稼働する。グットマンが提示したシナリオによれば、1人の従業員が数十のエージェントを持つこともあれば、組織が数百万のエージェントを持つこともある。そのため、利用量とコストは非線形に拡大する可能性があり、消費に対する明確なガバナンスと、各利用によって得られる価値の把握が必要になる。
グットマンは、投資対効果を処理したトークン数で測るべきだとは考えていない。基準となるのは、組織が以前と比べて異なる、あるいはより良い結果を達成しているかどうかだ。例として、顧客サポート、サイトの運用と信頼性の改善、Deutsche Telekomにおけるネットワークの自律的な管理などを挙げており、そこには予防保守も含まれる。これらは対談で示された例であり、本記事内で公表された定量的な結果や比較研究ではない。
対談が示す実務的な側面の一つは、実験コストの削減だ。グットマンは、以前ならエンジニアの作業に3〜4か月かかった可能性のあるアイデアのプロトタイプを、週末の間に構築したと述べた。彼は、そのモデルは本番投入可能なコードではなかったものの、設計上のリスクを早期に明らかにし、誤った方向に数か月間投資する可能性を減らすのに役立ったと説明した。ここでの価値は本番開発を置き換えることではなく、より大きなリソースを投入する前に仮説の検証を加速することにある。
エージェントはプラットフォームにとって新たな人格
グットマンは、プラットフォームチームがエージェントを、開発者、データサイエンティスト、データエンジニア、事業部門のユーザーと並んで、支援すべき人格として扱うことを提案している。これは、既存のツールがそのままエージェント時代へ移行するとは限らないことを意味するが、いくつかの軸は引き続き不可欠だ。すなわち、セキュリティとガバナンス、コスト、可用性とスケーラビリティ、そしてエージェント固有の運用監視である。
実際には、組織はエージェントが本番環境で何をしているのか、どのツールやデータを呼び出しているのか、それにいくらかかっているのか、そして求められた結果に向かって進んでいるのかを把握する必要がある。また、制御されていない利用を防ぐためのスキルと統制も必要になる。対談は、すべての運用上の判断をユーザーやエージェントに委ねるのではなく、インフラがエラー防止の責任をより多く担うべきだと示している。
グットマンは、人数が多くなくても、データサイエンティストやデータエンジニアをプラットフォームチームに加えることは有益になり得ると考えている。データエンジニアリングは、正確で管理され、実行可能なデータを適切な場所へ届けるために依然として不可欠である一方、不正検知や予測などのアプリケーションでは従来型の機械学習も引き続き活用される。これは、「AIファースト」がデータ品質や専門的な判断の必要性をなくすものではないことを示している。
新しい専門家は何を学ぶべきか
対談の最後に、グットマンは、数学、システム設計、技術の構築方法の理解を含むコンピューターサイエンスの基礎が引き続き重要だと強調し、ソフトウェアに重点が置かれていた数年を経て、ハードウェアの重要性も再び高まっていると指摘した。ただし、エージェントを使ってプログラミングし、エージェントを通じて成果を上げる能力は、ビジネス上の問題を理解することと併せて、求められるスキルになるとも付け加えた。
certi.newsによる編集上の読み解き:この記事が描いている実際の変化は、新しいプラットフォームやモデルの立ち上げではなく、ボトルネックが「モデルには能力があるか」から「システムをどう設計し、制御し、測定するか」へ移ったことにある。ただし、このインタビューはコスト削減に関する独立した数値や、比較可能な性能指標を提示しておらず、例も登壇者の経験と見解に基づいている。したがって、これは実務的な分析および設計上の方向性として捉えるべきであり、エージェントの利用を増やせばすべての組織がコストを削減できるという定量的な証拠とみなすべきではない。