Generalist AIは、ロボット向け基盤モデルGEN-1.5を発表した。このモデルにより、ロボットは、各タスク向けの専門的なプログラミングや個別の学習・ファインチューニング工程に頼ることなく、短い1回の実演から新しい物理タスクを学習できる。同社が公開した情報によると、モデルは3~12秒間の実演を分析し、段階的な更新や追加のファインチューニングなしでタスクを実行できる。
Generalist AIは、この種の例を「物理プロンプト」と呼んでいる。これは、実演で用いられるセンサーのデータと動作シーケンスを組み合わせたコンテキストである。GEN-1.5は、動画フレームに加えて、センサーデータ、言語、ロボットの位置および動作に関する情報を処理する。モデルは30秒間のコンテキストウィンドウを使用し、毎秒最大100個の動作コマンドを生成する。
性能に明確なばらつきがある初期結果
同社はこのモデルを10種類の短時間の操作タスクでテストし、1回の実演を用いた場合、平均成功率59%を達成した。5分間のデータで適応させた場合、各タスクにつき約50回の実演を含み、10回の勾配ステップにわたって、成功率は83%に上昇した。1分間のデータと1回の勾配ステップに基づく別のテストでは、モデルの成功率は66.5%だった。
これらの数字は、GEN-1.5が少数の例を活用できることを示す一方、性能がデータ量と適応の度合いに部分的に依存していることも明らかにしている。Generalist AIは、テストしたタスクが比較的単純かつ短時間であり、現在の成功率は依然として限定的だと認めている。
動作の模倣から新しいシーケンスの構築へ
このモデルは、目にした動作を単に繰り返すだけではない。ペンケースのファスナーを開ける場面と、そこから硬貨を取り出す場面を別々に見せられた際、物理プロンプトを1つの連続したシーケンスに統合することができた。また、実演には存在しなかった、再配置やエラーへの対処などの遷移動作も生成した。
同社の例は、予期しない状況に直面した際にモデルが戦略を変更できることも示した。ブラシを使って物体を容器に押し入れるタスクでは、GEN-1.5は同じ目的を達成するためにバナナを一時的な道具として使用した。スコップに直面した際には、それで押し続けるのではなく、物体を持ち上げて容器に入れた。また、容器を覆っていた紙にも対処し、指に引っかかったLegoのパーツをもう一方の手で取り除いた。
シミュレーションと人間の動作からの学習
このモデルは、シミュレーション環境で記録された実演を、追加の例なしで実際のロボットへ移行することもできる。シミュレーションのデータは事前学習段階には含まれていなかった。一部のタスクでは、ロボットのカメラを通じて人が手で行う動作を観察し、その後、ロボットの手を使ってタスクを再現することにも成功した。
実際には何が変わるのか?
このアプローチの意義は、ロボットの各タスクを個別にプログラミングする必要性を減らせる可能性にある。専門システムの準備に数カ月を費やす代わりに、将来的にはロボットの前で数秒間、望む動作を実演するだけで済むかもしれない。ただし、この結論は問題が解決されたことを意味しない。同社によると、GEN-1.5の事前学習は8カ月以上続いており、モデルは依然として限定的なタスクでテストされ、成功率も完全ではない。
Generalist AIによると、広範な物理的相互作用データで学習されたことで、モデルはより少ないデータと計算能力で新しいタスクに適応し始めた。同社は、コンテキスト内学習と即興の能力は、特別な学習方法や、これらの能力専用の追加目標なしに、事前学習中に自動的に現れたとしている。