機械学習モデルを、移動可能な身体やロボットと結び付ける身体性AIの分野では、投資が活発化している。しかし、ハードウェアの進歩には、価値ある作業を信頼性の高い形で実行する能力の同等の進歩がまだ伴っていない。このギャップが、現在の分野の状況を要約している。ロボットは身体的にはより高性能になったが、現実世界に対処するために必要な知識を備えることは、依然として未解決の課題である。
この矛盾は、身体性AI向けのモデルやインフラストラクチャーの開発者を対象にFoxgloveが主催した直近のActuateカンファレンスで明確になった。カンファレンスの規模は2023年の開始以来3倍になり、1,500人の参加者を集めた。これは、この分野への関心が高まっていることを示している。一方、インフラ企業は、ロボットが必要とする高品質で多様な訓練データの不足、つまりロボットデータ危機と呼ぶ問題に焦点を当てた。
なぜ身体的能力だけでは不十分なのか?
どのようなタスクでも実行できる汎用ロボットを構築する試みは、依然として成熟にはほど遠い。ロボットを特定のタスクについてエンドツーエンド学習で訓練した場合でさえ、こうした手法は、信頼できる安定した商用性能を備えた製品をまだ生み出していない。そのため開発者たちは、先端AI研究所が行ったことを再現しようとしている。より多様なデータセットを収集または作成し、複数の訓練手法を試し、強化学習のためのより優れたシナリオを設計している。
モデル開発者向けのシミュレーションツールを専門とするAntiochの創業者、Harry Mellsopは、身体性AIが「GPT-2」の段階にあると表現した。つまり、ChatGPTを大衆的なモデルにした飛躍の前段階だということだ。この見方によれば、現在の段階を乗り越えるには、より多くのデータと計算能力が必要になる。その中には、高精度なシミュレーションの構築に用いられるレイトレーシング技術向けに最適化されたGPUも含まれる。
ただし、言語モデルとの比較は、進む道筋が同一になることを意味しない。ロボットは変化する物理世界を扱い、テキストだけでなく、視覚データ、LiDARデータ、環境に結び付いた行動を必要とする。また、物理的なタスクでのミスは衝突や損傷、作業停止につながる可能性があるため、時折機能するモデルから信頼できる商用製品へ移行することは、より複雑になる。
自動運転車という初期の実験場
自動運転車は、身体性AIの中でも最も進んだ分野の一つに見える。人々が運転する車両から大量のデータを収集できることや、基本的な任務が物体を直接扱って動かすことではなく、衝突の回避を中心としていることが、その理由の一部である。モデル構築のための多くのツールは、自動運転車企業からロボット分野へ移ってきた。例えばFoxgloveは、General Motorsのかつての自動運転プロジェクトであるCruiseの元従業員によって設立された。
現在、自動車企業はこの経験を人型ロボット分野での競争に生かそうとしている。TeslaはOptimusロボットを開発している一方、自動運転を専門とするWayveとUberは、人型の身体に焦点を当てたロボット研究所を研究開発の取り組みとして設立した。
Wayveの最高経営責任者(CEO)であるAlex Kendallは、車両から始める方が合理的かもしれないと考えている。データとシミュレーションのインフラストラクチャー、そして機械学習の運用プロセスを、アプリケーション間で部分的に共有できるからだ。ただし、世界モデルには、それぞれの身体、ロボット、運用環境に関連する差異が必要になると強調している。また、センサーや部品が急速に進歩しているため、早い段階で一つのハードウェアプラットフォームに固定することは、リスクの高い判断になる。
専門化か、汎用ロボットか
分野に携わるすべての人が、「頭脳」と身体を分離する考えに同意しているわけではない。垂直統合型の人型ロボットを専門とするGenesis AIの最高経営責任者(CEO)、Théophile Gervetは、ハードウェアとAIを共に設計できるほど、波はまだ非常に初期段階にあると考えている。同社は今年、1億500万ドルのシードラウンドを調達した。
意見の相違は工学だけでなく、事業構築の戦略にも関わる。特定のタスクを対象とする企業は、ロボットを実際の現場に導入し始めている。Grittは太陽光発電所で稼働し、Agilityは産業環境にロボットを配備し、Bedrockは自律型掘削機を運用している。一方、多用途の人型ロボットは、依然として大部分が研究室の中にとどまっている。
Gervetによれば、顧客はタスクを80%の割合でしか成功させられない汎用ロボットには関心を持たない。分野への焦点が欠けていれば、実用的な価値も欠ける可能性があるからだ。しかし、専門化には別の問題も生じる。初期世代のモデルの上に垂直型製品を構築した場合、より高度なモデルを使う競合他社に追い抜かれる可能性がある。それでも、専門的なアプリケーションは、こうしたデータが汎用ロボットの開発に十分なほど多様でない場合でも、収益と現実世界のデータをもたらす。
Bedrockは、実際の条件下で物体を扱う際の課題を理解するため、まず掘削から始めている。しかし、複数の建設機械にまたがる知能レイヤーを構築する計画だ。これは、考えられる妥協案を示している。つまり、経験とデータを収集できる専門製品を投入しつつ、後により広範な能力を構築する目標を維持することである。
実際には何が変わっているのか?
インフラストラクチャーは、データそのものの問題への対処に向かっている。Foxgloveは、Nvidiaのオープンウェイト世界モデルCosmosを基盤とする新製品を発表した。この製品により、エンジニアは高度な自然言語クエリを使って視覚データとLiDARデータを検索できる。目的は、評価とシミュレーションを作成し、問題の切り分けと修正を迅速化することだ。こうしたツールの価値は、ロボットに身体的能力を加えることではなく、モデルが失敗した原因を発見し、再訓練するために必要な時間を短縮することにある。
より大きな問題は、ロボットにとって何がChatGPTの瞬間を形成するのかということだ。Kendallは、本当の瞬間は投資家ではなく消費者の関心を引き起こすものでなければならないと考えている。例として、目を監視する必要のない自動運転と、価格が1,000ドル未満のハードウェアを挙げている。Wayveは、自社モデルを自動車企業にライセンスすることで、その機会を追求しているという。Gervetは、自然な命令を理解し、押す、引く、ノートパソコンを閉じる、テーブルを掃除するといった基本的な操作タスクを、複雑な準備なしにおよそ80%以上の成功率で実行できるロボットが、画期的な指標になると考えている。
しかし、Foxgloveの最高経営責任者(CEO)であるAdrian Macneilは、ChatGPTに匹敵する単一の瞬間が訪れるとは予想していない。物理世界への普及は、インターネットを通じてソフトウェアを配布することよりはるかに難しいからだ。その代わりに、Apple IIやIBM PCの登場に似た瞬間を予想している。便利で楽しいタスクを実行する家庭用ロボットを購入できるようになる時だ。
これらの見解から得られる最も重要な読み取りは、進歩が汎用モデルから生まれるのか、ハードウェアとソフトウェアの共同設計から生まれるのか、それとも徐々に拡大する専門的なアプリケーションから生まれるのか、分野がまだ決着をつけていないということだ。利用可能な情報から確実に言えるのは、投資の増加と身体の改良によっても、根本的なボトルネックは解消されないということだ。現実的で多様なデータ、正確なシミュレーション、そして研究室の外で顧客が信頼できる性能が必要である。