何が起きたか

2025年10月2日にarXivに公開された論文(識別番号: 2510.01711v4)において、研究チームはVLAモデルのための新しい表現正則化手法「Robot State-aware Contrastive Loss (RS-CL)」を発表した。RS-CLは、事前学習済みのVision-Language Models (VLMs)の表現とロボットの自己受容状態を相対距離に基づいて整列させることで、制御関連の表現学習を強化する。実験では、RoboCasa-Kitchenベンチマークで従来の最先端手法を上回る69.7%の成功率を達成し、実ロボット操作タスクでは成功率を45.0%から58.3%に向上させた。

詳細

VLAモデルは、事前学習済みのVLMの豊かな表現を活用することでロボット操作において強力な能力を示してきたが、その表現は制御アクションや自己受容情報などのロボット信号に対する感度が不十分であると論文は指摘する。RS-CLはこのギャップを埋めるために設計され、ロボットの自己受容状態間の相対距離をソフト教師として用いることで、表現をより密接に整列させる。この手法は軽量であり、標準的なVLAトレーニングパイプラインと完全に互換性があるとされる。

Key Facts

RS-CLは、VLAモデルの表現とロボットの自己受容状態を相対距離で整列させる正則化手法である。[1]
RS-CLは、RoboCasa-Kitchenベンチマークで69.7%の成功率を達成し、最先端の性能を実現した。[1]
実ロボット操作タスクでは、成功率を45.0%から58.3%に向上させた。[1]
RS-CLは、事前学習済みのVision-Language Models (VLMs)の表現とロボット信号のギャップを埋めることを目的としている。[1]
RS-CLは、ロボットの自己受容状態間の相対距離をソフト教師として使用する。[1]
RS-CLは軽量で、標準的なVLAトレーニングパイプラインと完全に互換性がある。[1]
論文は2025年10月2日にarXivで公開された。[1]

なぜ重要か

この研究は、VLAモデルの表現学習におけるロボット信号の重要性を強調し、制御関連の表現を強化するためのシンプルで効果的な手法を提供する。RS-CLは、既存のVLAモデルに容易に統合できるため、ロボット操作の性能向上に広く貢献する可能性がある。