日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VLAarXiv:2610.08150

ViDAL: 視覚ダイナミクスに基づく視覚言語行動モデル用の行動潜在空間

ViDAL: A Visual Dynamics-Grounded Action Latent Space for Vision-Language-Action Models

シェア:XThreadsFacebookLINEはてブBluesky

行動が引き起こす未来の視覚変化に整合する連続行動潜在空間を学習し、複数のVLAモデルに組み込める行動インターフェースとして成功率を大幅に向上させた論文。

詳しい要約

1. どんなもの?

- Vision-Language-Action (VLA) モデル向けの新しい action 表現 - 名前は ViDAL: Visual Dynamics-grounded Action Latent Space - 連続 action latent を将来の視覚 dynamics に接地させる - 既存の action 表現は3種類 - raw action chunks - discrete action tokens - continuous action latents - ViDAL は Action Variational Autoencoder (Action VAE) を学習 - action chunks を再構成 - latent を将来の scene dynamics に整列 - 下流の robot policy に plug-in 可能な action interface - 複数の VLA アーキテクチャと互換 - 任意で future-video prediction も可能

2. 先行研究と比べてどこがすごい?

- 既存の action 表現は action trajectory を主にモデル化 - その action が引き起こす visual dynamics の考慮が限定的 - ViDAL は action latent を将来の視覚 dynamics に接地 - action とその結果生じる scene 変化を結びつける点が新しい - 下流 policy への統合が容易 - plug-in action interface として複数 VLA に適合 - future-video prediction を追加能力として任意で付与可能 - 実験的に競合 baseline を上回る - LIBERO で平均成功率 98.1% - RoboTwin 2.0 の multi-task π_{0.5} を改善 - 実機 Franka / ARX でも絶対成功率が向上

3. 技術・手法の肝は?

- Action Variational Autoencoder (Action VAE) を学習 - action chunks の再構成を目的に含む - その latent を将来の scene dynamics に整列 - これにより continuous action latent が視覚 dynamics に接地 - 下流の robot policy では Action VAE を plug-in action interface として利用 - 複数の VLA アーキテクチャに互換 - 任意で future-video prediction を追加可能 - 詳細な損失設計やアーキテクチャは要旨からは不明

4. どうやって有効だと検証した?

- LIBERO で評価 - 平均成功率 98.1% で競合 baseline を上回る - RoboTwin 2.0 で multi-task π_{0.5} policy を評価 - 50 dual-arm tasks において - Clean: 54.3% → 65.5% - Random: 33.2% → 43.1% - 実世界ロボットでも検証 - single-arm Franka で絶対成功率 +20.0% - dual-arm ARX で絶対成功率 +23.4% - 具体的な評価プロトコルや統計は要旨からは不明

5. 議論はある?

- 要旨では限界や失敗事例の議論は明示されていない - 考えられる論点 - future visual dynamics への整列がどの程度汎化に寄与するか - 複数 VLA への plug-in 互換性の範囲 - future-video prediction の有無による性能差 - 実機タスクの多様性や安全性 - これらは要旨からは不明

6. 次に読むべき論文は?

- 要旨で参照・比較されている研究 - Vision-Language-Action (VLA) モデル - raw action chunks - discrete action tokens - continuous action latents - Action Variational Autoencoder (Action VAE) - π_{0.5} policy - LIBERO - RoboTwin 2.0 - Franka - ARX - 関連手法として - future-video prediction - action latent space learning - robot policy learning - 具体的な論文名は要旨からは不明

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Yuan Xu, Yixiang Chen, Qisen Ma, Jiabing Yang, Peiyan Li, Kai Wang, Jianhua Yang, Jianlou Si, Jun Huang, Jing Liu, Nianfeng Liu, Yan Huang, Liang Wang

分類: cs.RO

原文アブストラクト

Vision-Language-Action (VLA) models have become a central paradigm for robot policy learning, which predict actions in three forms: raw action chunks, discrete action tokens, or continuous action latents. However, existing action representations primarily model action trajectories, with limited consideration of the visual dynamics induced by these actions. We introduce ViDAL, a Visual Dynamics-grounded Action Latent Space that anchors continuous action latents in the future visual dynamics of the scene. Specifically, ViDAL learns action latent space by training an Action Variational Autoencoder (Action VAE) to reconstruct action chunks while aligning its latent with future scene dynamics. When integrated into downstream robot policies, the proposed Action VAE serves as a plug-in action interface compatible with multiple VLA architectures and enables optional future-video prediction as an additional capability. Empirically, ViDAL outperforms competitive baselines on LIBERO with 98.1% average success, improves a multi-task $π_{0.5}$ policy on RoboTwin 2.0 from 54.3% to 65.5% (Clean) and from 33.2% to 43.1% (Random) success rates over 50 dual-arm tasks, and yields 20.0% and 23.4% absolute success-rate gains on real-world single-arm Franka and dual-arm ARX robot platforms.

関連論文

PR本紙発行元 EmplifAI