何が起きたか

研究チームは2026年3月31日、VLAモデルの新フレームワーク「DIAL」を発表した。DIALは、VLMベースのSystem-2が潜在世界モデリングを行い、VLMのネイティブ特徴空間内で潜在視覚予測を合成。この予測が意図を明示的に符号化し、構造的ボトルネックとして機能する。軽量なSystem-1ポリシーが、予測された意図と現在の観測を潜在逆動力学でロボットの正確な動作にデコードする。RoboCasa GR1 Tabletopベンチマークで、従来手法の10分の1のデモ数で新たなSOTAを達成した。

詳細

DIALは、VLMベースのSystem-2と軽量なSystem-1ポリシーから構成される。System-2は潜在世界モデリングにより、VLMのネイティブ特徴空間内で潜在視覚予測を合成し、意図を明示的に符号化する。System-1は、予測された意図と現在の観測を潜在逆動力学でロボットの正確な動作にデコードする。訓練は2段階で行われ、最初にSystem-2が潜在未来予測を学習し、System-1がグラウンドトゥルースの未来情報の下でモーター制御を学習する分離ウォームアップ段階を経て、その後エンドツーエンドの統合最適化を行う。これにより、アクション認識勾配がVLMバックボーンを制御された方法で微調整し、事前学習済み知識を保持する。実験では、RoboCasa GR1 Tabletopベンチマークで、従来手法の10分の1のデモ数で新たなSOTAを達成。さらに、異種の人間デモを活用することで、物理的に接地された操作プリミティブを学習し、実世界のヒューマノイドロボット展開において、未知の物体や新しい構成へのゼロショット汎化を示した。

Key Facts

DIALは、VLMベースのSystem-2が潜在世界モデリングを行い、VLMのネイティブ特徴空間内で潜在視覚予測を合成する。[1]
System-1ポリシーは、予測された意図と現在の観測を潜在逆動力学でロボットの正確な動作にデコードする。[1]
訓練は2段階で行われ、分離ウォームアップ段階の後にエンドツーエンドの統合最適化を行う。[1]
RoboCasa GR1 Tabletopベンチマークで、従来手法の10分の1のデモ数で新たなSOTAを達成した。[1]
異種の人間デモを活用し、実世界のヒューマノイドロボット展開で未知の物体や新しい構成へのゼロショット汎化を示した。[1]

本紙の見方

DIALの提案は、VLAモデルの設計におけるパラダイム転換を示す。従来のエンドツーエンドVLAは、VLMを単なるマルチモーダルエンコーダとして扱い、視覚言語特徴を直接低レベルアクションにマッピングしていた。これに対しDIALは、VLMの高次意思決定能力を活用し、潜在意図ボトルネックを介して低次モーター実行と橋渡しする。この構造は、VLMの豊かな意味表現を維持しつつ、訓練の安定性を向上させる。 本稿の過去報道との接続はないが、VLAモデルの進化という文脈では、データ効率の向上が重要なトレンドである。DIALは10分の1のデモ数でSOTAを達成しており、これはロボット学習におけるデータ不足問題への一つの解答を示す。特に、異種の人間デモを活用したゼロショット汎化は、実世界展開におけるロバスト性向上に寄与する。 業界構造への含意として、DIALの2段階訓練は、VLMの事前学習知識を保持しながらアクション認識勾配で微調整する手法であり、これは基盤モデルのロボット応用における一般的な課題に対する解決策となる。また、潜在意図ボトルネックは、解釈可能性の向上にもつながる可能性がある。 未確定の論点として、DIALの実世界展開における性能は、特定のヒューマノイドロボットでのゼロショット汎化が示されたが、他のロボットプラットフォームやより複雑なタスクでの汎化性は不明である。また、10分の1のデモ数という主張は、特定のベンチマークに基づくものであり、他のタスクでの再現性が確認される必要がある。さらに、2段階訓練の計算コストや、VLMバックボーンの規模が性能に与える影響も検討課題である。

なぜ重要か

DIALは、VLAモデルの設計において、VLMを単なるエンコーダではなく高次意思決定に活用する新しい枠組みを提示した。これにより、データ効率と汎化性能の両立が可能になる可能性があり、ロボット学習の実用化に向けた重要な一歩となる。