何が起きたか
ViDALは2026年10月6日、Vision-Language-Action(VLA)モデル向けに、未来の視覚的ダイナミクスに基づくAction Latent Spaceを提案した。論文は、Action VAEで行動チャンクを再構成しつつ、潜在表現を将来のシーン変化に整合させる方式を示している。VLAの行動表現を、軌跡そのものだけでなく実世界の見え方の変化に結び付ける点が特徴である。
詳細
ViDALは、連続的な行動潜在を将来の視覚ダイナミクスにアンカーする構成であり、下流のロボット方策に組み込むと、複数のVLAアーキテクチャに対応するプラグイン型の行動インターフェースとして使えるとしている。さらに、追加機能として将来動画予測も選択的に利用できるとしている。 性能面では、LIBEROで平均成功率98.1%を示したほか、RoboTwin 2.0の50個の双腕タスクで多タスクπ0.5方策をClean条件で54.3%から65.5%へ、Random条件で33.2%から43.1%へ改善した。実機では、単腕のFrankaと双腕のARXロボットプラットフォームで、それぞれ20.0%と23.4%の絶対成功率向上が報告された。
Key Facts
| ViDALは、Vision-Language-Action(VLA)モデル向けに、未来の視覚的ダイナミクスに基づくAction Latent Spaceを提案した。 | [1] |
| Action VAEで行動チャンクを再構成しつつ、潜在表現を将来のシーン変化に整合させる設計である。 | [1] |
| 下流のロボット方策に組み込むと、複数のVLAアーキテクチャに対応するプラグイン型の行動インターフェースとして使えるとしている。 | [1] |
| LIBEROで平均成功率98.1%を示した。 | [1] |
| RoboTwin 2.0の50個の双腕タスクで、多タスクπ0.5方策はClean条件で54.3%から65.5%へ、Random条件で33.2%から43.1%へ改善した。 | [1] |
本紙の見方
ViDALの新しさは、行動を単なる軌跡列として表すのではなく、将来の視覚的ダイナミクスに対応づけた潜在空間として学習する点にある。既存のVLAモデルでも行動トークンや連続潜在は使われてきたが、この論文は行動の表現と、その結果として生じる見え方の変化を結び直している。つまり、入力は言語と画像でも、内部表現は「次に何をするか」だけでなく「その結果として何が見えるか」まで含む構造になっている。 本紙の過去報道はないため、連続性を論じる対象はないが、論文の位置づけとしては、VLAの中間表現をより汎用的なインターフェースにしようとする流れの延長にある。Action VAEを下流方策に差し込めるとしている点は、特定アーキテクチャ専用の表現ではなく、複数のVLA構成にまたがる共通部品を狙っていることを示す。一方で、将来動画予測を追加機能として使える設計は、制御と予測を同じ潜在表現で扱う方向性でもあり、学習信号がどこまで制御性能に寄与しているかが焦点になる。 実験結果は、LIBEROの98.1%平均成功率、RoboTwin 2.0の50双腕タスクでの54.3%→65.5%と33.2%→43.1%という改善、さらに実機のFrankaとARXでの20.0%と23.4%の絶対向上という三段階で示されている。ここから読めるのは、シミュレーションだけでなく実機でも一定の改善を確認しようとしている点だが、どの条件でどの程度安定しているか、またAction VAEがどのVLA構成でどの程度汎用に効くのかはなお確認が必要である。とくに、モデルサイズ、学習データの性質、動画予測機能の有無による差、失敗例の内訳が見えてこないと、改善の要因は切り分けにくい。
なぜ重要か
Action表現を将来の視覚変化に結び付ける設計は、ロボット方策が「行動の列」だけでなく「行動後の状態」を扱う必要がある場面に関係する。論文が示した改善は、LIBERO、RoboTwin 2.0、Franka、ARXという異なる条件で確認されており、少なくとも評価系をまたいだ有効性の検討材料になる。