日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VLAarXiv:2608.03563v1

統一視覚運動ターゲット:物理的行動を超えたVLAの教師信号

Unified Visuomotor Targets: Supervising VLAs Beyond Physical Actions

シェア:XThreadsFacebookLINEはてブBluesky

VLAモデルの予測ターゲットを、モーター制御と視覚シーン遷移を統合した潜在表現に変更し、アーキテクチャ変更なしで学習効率と性能を向上させる手法を提案した。

詳しい要約

1. どんなもの?

本論文は、VLA (Vision-Language-Action) モデルの学習において、予測ターゲットを物理的なロボット動作(アクション)から、運動制御と視覚的なシーン遷移情報を統合した統一的な潜在表現(Unified Visuomotor Target, UVT)に変更する手法を提案している。アーキテクチャの変更や追加データを必要とせず、シミュレーションベンチマークと実機の双腕マニピュレーションタスクにおいて、学習効率、最終的なタスク性能、ロバスト性を向上させることを示している。

2. 先行研究と比べてどこがすごい?

従来のVLAモデルは、視覚と言語の観測からロボットのアクションを直接予測するように訓練されるが、これはVLMが持つ高次のシーンやゴールの表現と、低次元でタスク構造が限定的なアクションとの間にミスマッチを生じさせる。本手法は、アーキテクチャを変更するのではなく、予測ターゲットを変更することでこのミスマッチを解消し、より効率的で高性能なポリシー学習を実現する点が新しい。

3. 技術・手法の肝は?

手法の肝は、予測ターゲットを統一的な潜在表現(UVT)にすることである。UVTは、運動制御情報と視覚的なシーン遷移情報を同時にエンコードする。具体的には、アクションと次の観測(またはその変化)を共通の潜在空間に写像し、その潜在表現を予測するようにVLAを訓練する。これにより、モデルはアクションの詳細だけでなく、行動の結果としての視覚的な変化も学習し、よりリッチなタスク構造を捉えることができる。アーキテクチャは変更せず、予測ヘッドの出力と損失関数を変更するだけである。

4. どうやって有効だと検証した?

有効性の検証は、2つの代表的なVLAシステムを用いて、シミュレーションベンチマークと実機の双腕マニピュレーションタスクで行われた。評価指標は、学習効率(訓練ステップ数に対する成功率)、最終的なタスク成功率、およびロバスト性(環境条件の変化に対する成功率)である。特に、限られた訓練予算や困難な環境条件下での性能向上が顕著であることが示された。

5. 議論はある?

要旨からは、UVTの潜在表現が具体的にどのように構築されるか(例えば、どのような損失関数を用いるか、潜在空間の次元や正則化など)は不明である。また、提案手法がVLAのスケーラビリティや他のモダリティ(例えば、触覚)への拡張にどのように影響するかについての議論は要旨には含まれていない。さらに、UVTがアクション予測と比較して、どのようなタスクや環境で特に有利であるか、逆に不利な場合があるかについての詳細な分析も要旨からは不明である。

6. 次に読むべき論文は?

要旨で参照されている先行研究や関連手法は明示されていないが、VLAモデル(Vision-Language-Action models)の代表的な研究や、ロボットポリシー学習における予測ターゲットの設計に関する研究が関連する。具体的には、RT-2やPaLM-EなどのVLAモデル、および行動クローニングや模倣学習における予測ターゲットの研究が挙げられる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Zhenyang Feng, Unnat Jain

分類: cs.RO

原文アブストラクト

VLA models are trained to predict robot actions from visual and language observations. This is a natural choice, but it creates a mismatch: VLMs encode rich, high-level representations of scenes and goals, while robot actions are low-level signals with limited task structure. We ask whether changing what the policy is trained to predict, rather than how it is architecturally designed, can yield better and more efficiently trained policies. We propose UVT (Unified Visuomotor Target), a unified latent prediction target that jointly encodes motor control and visual scene transition information, requiring no architectural changes and no additional data. Applied to two representative VLA systems across simulation benchmarks and real bimanual manipulation tasks, UVT improves training efficiency, final task performance, and policy robustness, with particularly strong gains under limited training budgets and challenging environmental conditions. Rollout videos and additional qualitative results are available at our project webpage: https://unified-visuomotor-targets.github.io/