何が起きたか

arXivに2025年9月23日付で掲載された論文「OmniVLA: An Omni-Modal Vision-Language-Action Model for Robot Navigation」において、研究チームはロボットナビゲーション向けのオムニモーダルな視覚言語行動(VLA)モデル「OmniVLA」を発表した。このモデルは、2Dポーズ、自己中心画像、自然言語という3つの主要な目標モダリティとその組み合わせを、ランダム化されたモダリティ融合戦略を用いて訓練する。

詳細

従来のロボットナビゲーションポリシーは単一モダリティで訓練されることが多く、現実世界の多様な目標指定への適応が限られていた。OmniVLAは高容量のVLAバックボーンを活用し、複数のモダリティを融合することで、利用可能なデータセットのプールを拡大し、より豊かな幾何学的・意味的・視覚的表現を獲得する。 研究チームは、OmniVLAが未見環境への強い汎化、モダリティが不足した状況での堅牢性、新規の自然言語指示への追従能力を達成し、各モダリティの専門モデルを上回る性能を示したと報告している。また、新しいモダリティやタスクへの微調整のための柔軟な基盤を提供するとしている。

Key Facts

論文タイトルは「OmniVLA: An Omni-Modal Vision-Language-Action Model for Robot Navigation」で、arXivに2025年9月23日付で掲載された。[1]
OmniVLAは2Dポーズ、自己中心画像、自然言語の3つの主要な目標モダリティを訓練に使用する。[1]
訓練にはランダム化されたモダリティ融合戦略を用いる。[1]
OmniVLAは高容量の視覚言語行動(VLA)バックボーンを活用する。[1]
OmniVLAは未見環境への強い汎化、モダリティ不足への堅牢性、新規の自然言語指示への追従を達成したとされる。[1]
研究チームはOmniVLAが各モダリティの専門ベースラインを上回ると報告している。[1]
チェックポイントと訓練コードはプロジェクトページで公開予定。[1]

なぜ重要か

OmniVLAは、ロボットナビゲーションにおける目標指定の柔軟性を高めることで、実世界の多様なシナリオへの適応を可能にする。オムニモーダルなロボット基盤モデルの構築へのスケーラブルな道筋を示す点で意義がある。