何が起きたか

2023年7月28日、arXivに公開された論文で、Googleの研究チームは視覚言語行動モデル(VLA)の例としてRT-2を提案した。RT-2は、ロボットの観測から行動へのマッピングを学習しつつ、ウェブ規模の視覚言語データの事前学習の利点を活用する。6,000回の評価試験により、新規物体への汎化、訓練データにないコマンドの解釈、基本的な推論能力の獲得が示された。

詳細

RT-2は、最先端の視覚言語モデルをロボットの軌跡データとウェブ規模の視覚言語タスク(視覚質問応答など)で共同微調整する。行動をテキストトークンとして表現し、自然言語トークンと同じように訓練セットに組み込む。これにより、単一のエンドツーエンドモデルでロボット制御と大規模事前学習の利点を両立する。評価では、新規物体への汎化、特定の数字やアイコンへの配置などの未学習コマンドの解釈、最小・最大・他物体に最も近い物体の選択などの基本的推論、チェーン・オブ・ソートによる多段階推論(即席ハンマーに適した物体の選択、疲れた人に適した飲み物の選択)が確認された。

Key Facts

RT-2は、視覚言語モデルをロボット制御に直接組み込む視覚言語行動モデル(VLA)の例である。出典一覧
RT-2は、ロボットの行動をテキストトークンとして表現し、自然言語トークンと同様に訓練セットに組み込む。出典一覧
RT-2は、ロボット軌跡データとウェブ規模の視覚言語タスクで共同微調整される。出典一覧
評価は6,000回の試験で行われ、新規物体への汎化、未学習コマンドの解釈、基本的推論などの創発的能力が確認された。出典一覧
チェーン・オブ・ソート推論により、多段階のセマンティック推論(即席ハンマーに適した物体の選択など)が可能になる。出典一覧

本紙の見方

今回のRT-2は、ロボット制御における基盤モデルの活用という流れの中で、視覚言語モデルを直接エンドツーエンドの制御に組み込んだ点で新規性がある。従来のロボット学習は、タスク固有のデータで訓練されることが多く、汎化が課題だった。RT-2は、ウェブ規模の事前学習を活用することで、ロボットの訓練データにないコマンドや物体への対応を可能にし、セマンティック推論の創発を示した。これは、ロボットが単なる動作の模倣ではなく、言語と視覚の知識を行動に結びつける方向性を示す。 本紙の過去報道との接続はないが、この研究はロボット学習のパラダイム転換を示唆する。従来のロボット制御は、状態から行動への写像を直接学習するのに対し、RT-2は言語と視覚の知識を媒介にすることで、より柔軟な行動生成を実現する。これは、ロボットの汎用性を高める上で重要な一歩であり、今後のロボット基盤モデルの発展に影響を与える可能性がある。 業界構造への含意としては、ロボットの学習データの重要性が増す。ウェブ規模のデータを活用することで、ロボットの訓練コストを削減できる可能性がある一方、データの質やバイアスが問題になる。また、RT-2のようなモデルは、クラウド上の大規模モデルとロボットの組み合わせを促進し、エッジでの推論とクラウドの知識の融合が進むとみられる。 未確定の論点としては、RT-2の実ロボットへの展開における安全性や、実際の物理環境での性能が挙げられる。論文ではシミュレーションや限定的な実機評価が行われた可能性があるが、実世界の多様な状況での汎化はまだ検証が必要である。また、モデルの規模や計算コストも実用化の障壁となる。

なぜ重要か

RT-2は、ロボットがウェブ上の知識を直接活用して行動を決定できることを示し、ロボットの汎用性向上に寄与する。これは、ロボットの応用範囲を拡大し、産業や日常生活での活用を促進する可能性がある。また、視覚言語モデルとロボット制御の融合は、AIの新たな研究方向を示すものであり、今後の技術発展の基盤となる。