何が起きたか
2024年2月29日にarXivに公開された論文で、ヒューマノイドの歩行制御を言語モデルの「次の単語予測」と同様の枠組みで扱う手法が発表された。提案モデルは因果トランスフォーマーで、感覚運動軌跡を自己回帰的に予測する。フルサイズのヒューマノイドがサンフランシスコでゼロショット歩行を実現し、27時間の歩行データのみで訓練しても実世界へ転移できると報告している。
詳細
論文は、実世界のヒューマノイド制御を「次のトークン予測」問題として定式化する。モデルは因果トランスフォーマーで、感覚運動軌跡を自己回帰的に予測する。データのマルチモーダル性に対応するため、モダリティ整合的な予測を行い、各入力トークンに対して同じモダリティの次のトークンを予測する。この定式化により、行動を含まないビデオ軌跡など、欠損モダリティを持つデータも活用できる。訓練データは、以前のニューラルネットワークポリシー、モデルベース制御器、モーションキャプチャデータ、人間のYouTubeビデオから得られたシミュレーション軌跡のコレクションである。
Key Facts
| 提案モデルは因果トランスフォーマーで、感覚運動軌跡を自己回帰的に予測する。 | [1] |
| モデルはモダリティ整合的な予測を行い、各入力トークンに対して同じモダリティの次のトークンを予測する。 | [1] |
| 訓練データは、以前のニューラルネットワークポリシー、モデルベース制御器、モーションキャプチャデータ、人間のYouTubeビデオから得られたシミュレーション軌跡のコレクションである。 | [1] |
| フルサイズのヒューマノイドがサンフランシスコでゼロショット歩行を実現した。 | [1] |
| 27時間の歩行データのみで訓練しても実世界へ転移でき、訓練時に見られなかった後ろ歩きなどのコマンドに一般化できる。 | [1] |
本紙の見方
今回の研究は、ヒューマノイド制御を言語モデルのパラダイムに統合する試みとして位置づけられる。従来の制御手法が物理モデルや強化学習に基づくのに対し、感覚運動軌跡を「次のトークン予測」として扱う点が新しく、生成モデルのスケーリング則がロボット制御にも適用可能であることを示唆する。特に、モダリティ整合的な予測により、行動ラベルのないビデオデータを訓練に利用できる点は、データ収集のコストを下げる可能性がある。 本紙の過去報道との接続は、関連記事が提供されていないため直接の言及は避けるが、ロボット学習における基盤モデル化の流れは、近年のAI分野のトレンドと一致する。 業界構造への含意としては、この手法が確立すれば、ヒューマノイドの制御ソフトウェアがデータ駆動型の生成モデルに置き換わる可能性がある。これにより、従来のモデルベース制御や強化学習に依存していた企業の技術的優位性が揺らぐ一方、データ収集能力や計算リソースを持つ企業が有利になる。また、YouTubeなどの既存の動画データを活用できるため、データの調達コストが低下し、参入障壁が下がる可能性もある。 未確定の論点としては、実機での歩行がどの程度の堅牢性を持つか、シミュレーションと実機のギャップ(シムトゥリアルギャップ)がどの程度解消されたか、また、この手法が歩行以外の操作タスクにどの程度一般化するかが焦点になる。さらに、27時間のデータで転移可能とされるが、そのデータの質や多様性が結果に与える影響も検証が必要である。
なぜ重要か
この研究は、ロボット制御を生成モデルの枠組みで捉えることで、データと計算資源のスケールがそのまま性能向上につながる可能性を示す。ヒューマノイドの実用化に向けて、制御アルゴリズムの開発競争がデータと基盤モデルの競争へとシフトすることを示唆しており、業界の技術戦略に影響を与える。