何が起きたか
arxiv.orgに2026年5月13日付で公開された論文で、RotVLAという新しいVLAフレームワークが提案された。RotVLAは連続的な回転潜在アクション表現を用い、1.7BパラメータでLIBERO 98.2%、RoboTwin2.0で89.6%/88.5%を達成した。
詳細
RotVLAは、潜在アクションをSO(n)の要素としてモデル化する。トリプレットフレーム学習フレームワークにより、時間的ダイナミクスを強化し、退化を防ぐ。VLMバックボーンとフローマッチングアクションヘッドで構成され、大規模なクロスエンボディロボットデータセットと人間のビデオで事前学習される。下流のロボット制御では、フローマッチングヘッドを拡張して統一アクションエキスパートとし、潜在アクションを潜在プランナーとして利用する。
Key Facts
| RotVLAは連続的な回転潜在アクション表現を導入し、潜在アクションをSO(n)の要素としてモデル化する。 | [1] |
| RotVLAは1.7Bパラメータと1700時間以上の事前学習データで、LIBEROで98.2%、RoboTwin2.0で89.6%/88.5%を達成した。 | [1] |
| RotVLAは実世界の操作タスクで既存VLAモデルを一貫して上回る性能を示したとしている。 | [1] |
本紙の見方
RotVLAの提案は、VLAモデルの事前学習における潜在アクション表現の設計に一石を投じるものだ。従来の離散量子化に基づくLAMは、フレーム再構成の自明化や表現能力の限界、物理的意味構造の欠如といった課題を抱えていた。RotVLAは連続的な回転表現を採用することで、これらの問題を回避し、実世界のアクションのダイナミクスに整合する幾何学的構造を獲得している。 本紙の過去報道との接続はないが、VLAモデルの進化という文脈では、ロボット学習におけるデータの多様性とスケーラビリティの課題に対する一つの解を示している。特に、クロスエンボディデータと人間のビデオを活用した事前学習は、ロボットポリシーの汎化を目指す流れの延長線上にある。 業界構造への含意として、RotVLAの成功は、潜在アクション表現の設計がモデル性能に直結することを示唆する。これにより、VLAモデルの開発競争において、表現学習の方法論が重要な差別化要因となる可能性がある。また、1.7Bパラメータという比較的小規模なモデルで高い性能を達成したことは、計算資源の制約がある研究機関や企業にとっても参入障壁を下げる可能性がある。 未確定の論点としては、実世界での性能評価の詳細や、他のベンチマークでの汎化性、学習データの構成とスケールの影響などが挙げられる。また、連続的な回転表現が実際のロボット制御においてどの程度の堅牢性を持つかは、さらなる検証が必要だ。
なぜ重要か
RotVLAは、VLAモデルの潜在アクション表現に連続的な回転構造を導入することで、従来の離散量子化の限界を克服し、高いベンチマーク性能を達成した。これは、ロボット学習における表現設計の重要性を示すとともに、より効率的で汎用的なロボット制御への道を開く可能性がある。