何が起きたか

arXivに2025年5月21日付で公開された論文「FLARE: Robot Learning with Implicit World Modeling」において、研究者らはFuture Latent Representation Alignment(FLARE)を発表した。FLAREは、拡散トランスフォーマーの特徴と将来観測の潜在埋め込みを整列させることで、政策が行動生成中に長期的な結果を推論できるようにする。標準的な視覚言語行動(VLA)モデルに数トークンを追加するだけでよく、単腕およびヒューマノイドのテーブルトップ操作を含む2つのマルチタスク模倣学習ベンチマークで、従来の政策学習ベースラインを最大26%上回る最先端の性能を達成した。

詳細

FLAREは、拡散トランスフォーマー政策に将来観測の潜在表現を予測させることで、行動生成中に長期的な結果を推論できるようにする。このフレームワークは非常に軽量で、標準的なVLAモデルに数トークンを追加するだけでよい。 実験では、単腕およびヒューマノイドのテーブルトップ操作を含む2つの挑戦的なマルチタスク模倣学習ベンチマークで評価され、従来の政策学習ベースラインを最大26%上回る性能を達成した。さらに、FLAREは行動ラベルのない人間の自己中心視点ビデオデモンストレーションとの共訓練を可能にし、単一のロボットデモンストレーションだけで、未見の形状を持つ新規物体への政策の一般化を大幅に向上させた。

Key Facts

FLAREはFuture Latent Representation Alignmentの略で、拡散トランスフォーマー政策に将来観測の潜在表現を予測させるフレームワークである。[1]
FLAREは標準的な視覚言語行動(VLA)モデルに数トークンを追加するだけでよい。[1]
FLAREは単腕およびヒューマノイドのテーブルトップ操作を含む2つのマルチタスク模倣学習ベンチマークで評価された。[1]
FLAREは従来の政策学習ベースラインを最大26%上回る性能を達成した。[1]
FLAREは行動ラベルのない人間の自己中心視点ビデオデモンストレーションとの共訓練を可能にする。[1]
FLAREは単一のロボットデモンストレーションだけで、未見の形状を持つ新規物体への政策の一般化を大幅に向上させた。[1]
論文はarXivに2025年5月21日付で公開された。[1]

なぜ重要か

FLAREは、ロボット政策学習に暗黙的ワールドモデリングを統合する一般的でスケーラブルなアプローチを提供する。最小限の変更で大きな性能向上を達成し、ラベルなしの人間デモデータを活用できることから、ロボット学習の効率と一般化を向上させる可能性がある。