何が起きたか

arXivに2026年6月19日付で公開された論文「Imitation from Heterogeneous Demonstrations using Grounded Latent-Action World Models」において、研究チームはGLAM(Grounded Latent-Action World Model)を提案した。GLAMは、異なるアクション空間を持ち、アクションラベルが欠如していることも多い異種デモデータを活用する。実験では、シミュレーションと実世界の5つの操作タスクにおいて、GLAMで整列されたポリシーが、行動クローニングのベースラインや既存の潜在アクション手法を大幅に上回り、同じデータ不足設定でタスク成功率を平均48%向上させた。

詳細

既存の共訓練アプローチは、異種データソースを組み合わせる際にヒューリスティックで手作りの整列技術に依存していた。これに対し、研究チームはアクション表現を予測に基づいて接地すべきだと主張する。つまり、環境に対して同じ効果を生むアクションは、ソースが異なっても同じ表現を共有すべきである。この原理を実装するため、GLAMはデータソース間で共有される潜在アクション空間を持つ生成モデルのペアを用い、将来の観測を一貫して予測することで接地する。この潜在アクション空間は、観測を潜在アクションにマッピングし、それをロボットアクションにデコードする下流の行動クローニングポリシーの訓練に使用される。

Key Facts

論文はarXivで2026年6月19日に公開された(ソース0)。[1]
GLAMはGrounded Latent-Action World Modelの略である(ソース0)。[1]
GLAMは、アクションラベルが欠如している異種データソースを活用する(ソース0)。[1]
GLAMは、データソース間で共有される潜在アクション空間を持つ生成モデルのペアを使用する(ソース0)。[1]
GLAMは、将来の観測を一貫して予測することで潜在アクション空間を接地する(ソース0)。[1]
GLAMは、観測を潜在アクションにマッピングし、それをロボットアクションにデコードする行動クローニングポリシーの訓練に使用される(ソース0)。[1]
実験はシミュレーションと実世界の5つの操作タスクで行われた(ソース0)。[1]
GLAMで整列されたポリシーは、ベースラインと既存の潜在アクション手法を大幅に上回り、タスク成功率を平均48%向上させた(ソース0)。[1]
ビデオとコードはhttps://viccccciv.github.io/glam/で入手可能である(ソース0)。[1]

なぜ重要か

この研究は、異種データソースからの模倣学習における重要な課題に対処するものであり、アクション表現を予測に基づいて接地するという新しい原理を提案している。GLAMは、アクションラベルがないデータを活用できるため、デモデータの規模と品質の制約を緩和し、ロボット学習の一般化と安定性を向上させる可能性がある。