日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VLA/操作arXiv:2608.26821

TemporalFlow-VLA: 物理的に基づいた実行履歴を学習する長期的ロボット操作

TemporalFlow-VLA: Learning Physically Grounded Execution History for Long-Horizon Robot Manipulation

シェア:XThreadsFacebookLINEはてブBluesky

視覚言語行動モデルに物理的な時間的監督を導入し、多段階操作の実行履歴をコンパクトに学習する手法を提案。LIBEROやRoboTwinで高い成功率を達成し、長期的な操作で優位性を示した。

詳しい要約

1. どんなもの?

TemporalFlow-VLAは、Vision-Language-Action (VLA)モデルに物理的に接地された実行履歴を学習させる手法を提案する。ロボットの状態、ロボットの幾何学、校正済みカメラを用いて、ロボットと表面の間の時間的フロー(robot-surface temporal flow)をトレーニング専用のターゲットとして構築し、実行に整合した2つの時間的クエリを教師あり学習する。これにより、視覚的に類似した状態でも過去の実行に応じて異なるアクションが必要な多段階操作において、コンパクトな実行履歴を提供する。推論時には幾何学的監督や明示的な動き推定を必要とせず、非同期の特徴キャッシングにより単一フレームレベルのサンプリング遅延を維持する。

2. 先行研究と比べてどこがすごい?

従来のVLAモデルは、単に履歴フレームを追加するだけでは物理的な変化を捉えられず、特に多段階操作で視覚的に類似した状態が異なるアクションを要求する問題に対処できなかった。TemporalFlow-VLAは、物理的に接地された時間的監督(robot-surface temporal flow)を導入し、実行履歴を構造化してアクションエキスパートに提供する点が新しい。また、推論時に幾何学的処理や明示的な動き推定を不要とし、追加の履歴エンコーディングオーバーヘッドなしで単一フレームレベルの遅延を維持する点で優れている。

3. 技術・手法の肝は?

手法の核心は、トレーニング中にロボットの状態、ロボットの幾何学、校正済みカメラを用いてロボットと表面の間の時間的フロー(robot-surface temporal flow)を構築し、これをトレーニング専用のターゲットとして使用すること。この幾何学的監督により、実行に整合した2つの時間的クエリ(execution-aligned temporal queries)を学習し、アクションエキスパートに構造化された履歴を提供する。推論時には、この幾何学的監督パスは評価されず、非同期の特徴キャッシングにより時間的条件付けを実現し、追加の履歴エンコーディングオーバーヘッドなしで単一フレームレベルのサーバーサイドサンプリング遅延を維持する。

4. どうやって有効だと検証した?

LIBEROベンチマークで平均成功率97.63±0.26%を達成し、特にLIBERO Longでは96.60±0.87%を記録。また、12のRoboTwinタスクでClean/Randomized成功率85.5%/84.2%を達成。長いホライズンで多段階の操作タスクにおいて、先行手法と比較して最も明確な優位性を示した。さらに、制御された履歴介入実験により、アクション予測が履歴の内容と時間的順序の両方に依存することを示した。

5. 議論はある?

要旨からは、提案手法の限界や潜在的な欠点についての議論は明示されていない。ただし、幾何学的監督がトレーニング専用であり、推論時には不要であることから、実環境での適用可能性が高いと考えられる。また、履歴介入実験により、履歴の内容と順序の重要性が示されたが、具体的な介入方法や結果の詳細は要旨からは不明。

6. 次に読むべき論文は?

要旨で参照されている先行研究や関連手法は明示されていないが、VLAモデルやロボット操作の分野では、RT-2やOctoなどのVLAモデル、およびLIBEROやRoboTwinなどのベンチマークが関連する。次に読むべき論文としては、VLAモデルの基盤となるVision-Language Pretrainingを活用したロボット制御の研究(例:RT-2)や、多段階操作のための階層的アプローチを扱った論文が考えられる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Jiarui Yang, Yehao Lu, Yuning Su, Yu Zhong, Yufeng Xie, Yazhou Zhang, Haiyu Lan, Kaixiang Lu, Peiwen Lin, Chuang Wang, Junwei Liang, Enyu Li

分類: cs.RO

原文アブストラクト

Vision-language-action (VLA) models leverage pretrained vision-language representations for robot control, yet simply adding historical frames does not reliably capture recent physical change. This is especially problematic in multi-stage manipulation, where visually similar states may require different actions depending on prior execution. To address this challenge, we present TemporalFlow-VLA, which learns compact execution history through physically grounded temporal supervision. Using recorded robot states, robot geometry, and calibrated cameras, we construct robot-surface temporal flow as a training-only target and supervise two execution-aligned temporal queries that provide structured history to the action expert. The geometric supervision path is not evaluated at deployment. TemporalFlow-VLA achieves 97.63 +/- 0.26% average success on LIBERO, including 96.60 +/- 0.87% on LIBERO Long, and 85.5%/84.2% Clean/Randomized success across 12 RoboTwin tasks. It shows its clearest advantage over prior methods on longer-horizon, multi-stage manipulation. Controlled history interventions show that action prediction depends on both historical content and temporal order. With asynchronous feature caching, temporal conditioning maintains single-frame-level server-side sampling latency without additional historical-encoding overhead. Overall, TemporalFlow-VLA provides a compact, physically grounded interface for exploiting ordered execution history without explicit motion estimation or geometric processing at deployment.

関連論文