何が起きたか
研究チームは2026年8月30日、ワンステップで動作チャンクを生成する視覚言語行動モデル(VLA)「DriftingVLA」を発表した。従来のフローベースVLAは多段階の反復処理を必要とし、オンライン制御の遅延が課題だったが、DriftingVLAは単一の順伝播で完全な動作チャンクを生成する。評価ではLIBEROで98.32%、RoboTwin 2.0で81.09%、実世界の6タスクで77.67%の成功率を達成し、動作チャンク生成を3.36倍高速化した。
詳細
DriftingVLAは、フローフィールドの反復積分を学習する代わりに、分布ドリフト目的関数を用いてノイズから動作チャンクへの直接マッピングを学習する。さらに、各動作次元の時間的軌跡を独立したドリフト単位として扱う「Per-Dimension Temporal Drifting (PDTD)」を導入。この分解は学習目的にのみ適用され、共有VLAモデルは動作チャンク全体を共同生成するため、次元間の依存関係を保持する。評価では、複数ステップのフローポリシーやワンステップVLAベースラインを上回った。
Key Facts
| DriftingVLAは、単一のアクションエキスパート順伝播で完全な動作チャンクを生成するネイティブ・ワンステップVLAである。 | [1] |
| LIBEROで98.32%、RoboTwin 2.0で81.09%、実世界の6タスクで77.67%の成功率を達成した。 | [1] |
| 動作チャンク生成を3.36倍高速化し、反復処理を排除した。 | [1] |
| Per-Dimension Temporal Drifting (PDTD)は、各動作次元の時間的軌跡を独立したドリフト単位として扱う。 | [1] |
| PDTDは学習目的にのみ適用され、共有VLAモデルは動作チャンク全体を共同生成する。 | [1] |
本紙の見方
今回の発表は、ロボット制御におけるVLAの推論遅延という根本的な課題に取り組んだ点で新規性が高い。従来のフローベースVLAは、表現力の高い連続動作生成を可能にする一方で、各動作チャンクの生成に多段階の反復処理を必要とし、オンライン制御のリアルタイム性を損なっていた。DriftingVLAは、分布ドリフト目的関数を導入することで、ノイズから動作チャンクへの直接マッピングを学習し、単一の順伝播で生成を完了する。これにより、反復処理を排除しつつ、制御性能を維持したまま3.36倍の高速化を実現した。 本手法の核心は、動作次元ごとの分布特性を考慮したPDTDにある。ロボットの動作次元はそれぞれ異なる制御意味論と分布特性を持つが、従来の手法ではこれを一括して扱うことが多かった。PDTDは各次元の時間的軌跡を独立したドリフト単位として扱うことで、より細かい粒度での分布整形を可能にする。一方で、この分解は学習目的にのみ適用され、生成時には共有モデルが動作チャンク全体を共同生成するため、次元間の依存関係を保持できる。この設計は、学習時の柔軟性と推論時の整合性を両立させる点で巧妙である。 業界構造への含意として、この手法はロボット制御のリアルタイム性を向上させることで、VLAの実世界展開を後押しする可能性がある。特に、単一の順伝播で動作を生成できることは、計算資源が限られたエッジデバイスでの推論を容易にし、ロボットの応答性を高める。また、フローベース手法と比較して、反復処理を排除することで、推論時の計算コストを削減できる。これは、ロボットのコスト構造や導入障壁に影響を与える可能性がある。 未確定の論点としては、実世界のタスク数が6つと限定的であり、より多様な環境や複雑な操作での性能が未知である点が挙げられる。また、PDTDの分解が学習に与える影響の詳細や、他のVLAアーキテクチャへの適用可能性も今後の検証が待たれる。さらに、3.36倍の高速化が実際のロボット制御ループでどの程度の遅延改善につながるかは、ハードウェアや通信遅延に依存するため、実機での評価が重要になる。
なぜ重要か
DriftingVLAは、VLAの推論遅延という実用上のボトルネックを解消する可能性を示した。ワンステップ生成による高速化は、ロボットのリアルタイム制御を必要とする応用(例えば、動的環境での操作や人間との協調)において、VLAの実用性を大きく高める。また、PDTDによる次元別の分布整形は、動作生成の精度向上に寄与する新しいアプローチであり、今後のVLA研究に影響を与える可能性がある。