何が起きたか

研究チームは、3D世界で動作する身体化されたマルチモーダル汎用エージェント「LEO」を発表した。LEOは、3D視覚言語アライメントと3D視覚言語行動指示チューニングの2段階で訓練され、3Dキャプション、質問応答、身体化推論、ナビゲーション、操作などのタスクで優れた能力を実証した。

詳細

LEOは、大規模言語モデルから得られる知識を活用し、3D入力の処理、3D世界に本質的に定義されたタスク(3D接地、身体化推論、行動)を扱うことを目的とする。訓練は統一されたタスクインターフェース、モデルアーキテクチャ、目的関数を用いて2段階で行われる。第1段階は3D視覚言語アライメント、第2段階は3D視覚言語行動指示チューニングである。研究チームは、オブジェクトレベルとシーンレベルの多様なタスクを含む大規模データセットを収集し、LLM支援パイプラインで高品質な3D視覚言語データを生成した。実験では、3Dキャプション、質問応答、身体化推論、ナビゲーション、操作など幅広いタスクでLEOの顕著な能力を示した。

Key Facts

LEOは、3D世界で知覚、接地、推論、計画、行動を行う身体化されたマルチモーダル汎用エージェントである。[1]
LEOは、3D視覚言語アライメントと3D視覚言語行動指示チューニングの2段階で訓練される。[1]
研究チームは、オブジェクトレベルとシーンレベルの多様なタスクを含む大規模データセットを収集した。[1]
LEOは、3Dキャプション、質問応答、身体化推論、ナビゲーション、操作などのタスクで顕著な能力を示した。[1]
研究チームは、LLM支援パイプラインを用いて高品質な3D視覚言語データを生成した。[1]

なぜ重要か

LEOは、3D世界で言語理解と行動を統合するエージェントの新たな可能性を示す。これは、ロボットが実世界で複雑な指示を理解し実行するための基盤技術として重要であり、今後の身体化AIの研究開発に影響を与えるとみられる。