何が起きたか

arXivに投稿された論文(2608.06965v1)で、シーンカメラの視点変化に対する頑健性を高める手法が提案された。提案手法は、フローベースのVLAポリシーにおいて、アクション等価なビューペアを構築し、クロスビュー損失でアクションフローの速度場を正則化する。LIBERO-Plusカメラ摂動トラックで87.2±0.4%を達成し、フローマッチングのみの訓練(79.8±0.8%)を+7.4ポイント上回った。実ロボットでは、3つのテーブルトップタスクで保持カメラ成功率が53.3%から74.4%に向上した。

Key Facts

視覚言語行動(VLA)ポリシーは、固定シーンカメラから微調整されると、タスク、オブジェクト、言語、ロボット状態が同じでも、カメラが移動すると失敗する可能性がある。[0]
提案手法は、シーンRGB画像、言語、プロプリオセプションのみを使用し、カメララベル、外部パラメータ、深度、点群入力を用いない。[0]
手首ストリームは、シーンカメラの変動への帰属を妨げる未摂動の視覚的ショートカットを防ぐために、全体を通してマスクされる。[0]
フローベースのVLAでは、連続アクションチャンクを生成するために直接統合される量であるアクションフロー速度場を正則化する。[0]
アクション等価なビューペアは、元のLIBEROデモを同じMuJoCo状態にリセットし、ノミナルおよび摂動されたシーンカメラビューをレンダリングすることで構築される。[0]
両方のビューはフローマッチングで監視され、クロスビュー損失は、同じサンプリングされたフロー座標で予測されたアクションフロー速度が一致することを促す。[0]
LIBERO-Plusカメラ摂動トラックで、提案手法は87.2±0.4%を達成(3つのトレーニングシードでシードあたり4,797ロールアウト)。[0]
これは、同じペアデータでのフローマッチングのみのトレーニング(79.8±0.8%、3シード)を+7.4ポイント、ナイーブな混合カメラSFTを+12.5ポイント上回る。[0]
ノミナルカメラのIDパフォーマンスは維持される(95.0±0.8%; 同じデータのFMのみ: 95.0±4.3%)。[0]
シャッフルされたペアのコントロールは25.8%に低下し、ゲインがアクション等価なペアリングに依存することを示している。[0]
実ロボットでは、3つのテーブルトップタスクをタスクとカメラ配置ごとに10ロールアウトで評価し、保持カメラ成功率は同じ単一シーンRGB推論インターフェースで53.3%から74.4%に向上した。[0]

なぜ重要か

この研究は、カメラ位置の変化に対するVLAポリシーの頑健性を向上させる手法を提案しており、実世界のロボット展開においてカメラ配置の変更が性能に与える影響を軽減する可能性がある。