日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VLAarXiv:2608.11521v1

未来を保持し、ロールアウトを捨てる:ワールドアクションモデルのためのRIFT

Keep the Future, Drop the Rollout: RIFT for World Action Models

シェア:XThreadsFacebookLINEはてブBluesky

ロボットの行動生成に使われる将来予測の反復的なビデオ生成を不要にし、学習された予測トークンで将来のキャッシュを一度に構築する手法RIFTを提案。LIBEROとRoboTwinで高い成功率と低遅延を実現した。

詳しい要約

1. どんなもの?

本論文は、World Action Models (WAMs) における反復的なビデオロールアウトの必要性を問い、ロールアウトなしで将来の表現を構築する手法 RIFT (Rollout-free Imagination via Future Tokens) を提案する。WAMs は予測された未来をロボットの行動生成に条件付けするが、反復的なビデオロールアウトは展開時のレイテンシを増大させる。著者らは、行動生成に必要なのはロールアウトの軌跡そのものではなく、その未来表現(K/V cache)であると仮定し、固定された最終クリーンな K/V cache を再利用しても性能が維持されることを示す。RIFT は学習された anticipation tokens を用いて、1回のバックボーンパスで完全な未来 K/V cache を構築し、元の未来読み取りインターフェースを保持する。これにより、反復的なビデオ生成なしでロールアウトフリーの未来条件付けを実現する。

2. 先行研究と比べてどこがすごい?

先行研究の WAMs は、行動生成のために反復的なビデオロールアウトを必要とし、展開時のレイテンシが課題であった。本研究は、ロールアウトの軌跡全体ではなく、その未来表現(K/V cache)のみが行動生成に重要であることを示し、固定キャッシュの再利用可能性を発見した点が新しい。さらに、学習された anticipation tokens を用いてキャッシュを直接構築する RIFT を提案し、ロールアウトを排除しながら同等以上の成功率を達成する。これにより、展開時のレイテンシを大幅に削減できる点が先行研究と比べて優れている。

3. 技術・手法の肝は?

手法の肝は、WAMs の将来条件付けが K/V cache の値とその位置に敏感であることを利用し、ロールアウトを介さずにキャッシュを構築すること。具体的には、まず閉ループ介入実験により、固定された最終クリーンな K/V cache を再利用しても性能が維持されることを確認する。次に、RIFT では学習された anticipation tokens を導入し、これらをバックボーンに通すことで、1回のパスで完全な未来 K/V cache を生成する。このキャッシュは元の未来読み取りインターフェースに適合するため、モデルのアーキテクチャを変更せずにロールアウトを置き換えることができる。

4. どうやって有効だと検証した?

有効性は、LIBERO ベンチマークの全40タスクと RoboTwin 2.0 で検証された。まず、4つの WAMs に対して閉ループ介入を行い、キャッシュのマスキングや再割り当てが成功率を低下させる一方、固定キャッシュの再利用がほぼ元の性能を維持することを示した(Joint と Cosmos-2 で成功率 97.9%〜98.2%、平均変位誤差 1.7〜1.9 cm)。次に、RIFT を LIBERO で評価し、成功率 98.8% を達成し、ロールアウトベースの Joint、IDM、LingBot-VA(98.4%〜98.6%)と同等であることを示した。さらに、action-chunk レイテンシを 68.2%〜89.1% 削減した。RoboTwin 2.0 では、クリーン/ランダム化シーンで 92.9%/92.6% の成功率を達成し、評価した手法の中で最高を記録した。

5. 議論はある?

議論として、固定キャッシュの再利用が可能なモデル(Joint と Cosmos-2)とそうでないモデルが存在することが挙げられる。これは、モデルによってキャッシュの消費方法が異なることを示唆しており、RIFT の適用可能性に影響する。また、RIFT はキャッシュ構築を学習するため、ロールアウトで得られるキャッシュと完全に一致するとは限らず、性能の僅かな差が生じる可能性がある。さらに、本研究は主にシミュレーション環境で検証されており、実世界での有効性は要旨からは不明である。

6. 次に読むべき論文は?

次に読むべき論文は、要旨で比較されている Joint、IDM、LingBot-VA などのロールアウトベースの WAMs に関する研究、および Cosmos-2 などの基盤モデルを利用した世界モデルの研究が挙げられる。また、将来のキャッシュ構築に関する類似手法として、学習された anticipation tokens を用いた手法や、効率的なビデオ生成を目指す研究も関連する。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Chushan Zhang, Jinguang Tong, Xuesong Li, Yikai Wang, Hongdong Li

分類: cs.RO, cs.AI

原文アブストラクト

World action models (WAMs) condition robot actions on predicted futures, but iterative video rollout increases deployment latency. We ask whether action generation requires the evolving rollout trajectory or only its future representation. Across four WAMs on all 40 LIBERO tasks, paired closed-loop interventions show that masking or reassigning future-cache values changes execution and reduces success, indicating sensitivity to future values and their assigned positions. For Joint and Cosmos-2, however, replaying one fixed final-clean key/value (K/V) cache nearly preserves unmodified execution, with $1.7$ to $1.9$~cm end-effector average displacement error and $97.9\%$ to $98.2\%$ success. This separates cache consumption from production: these models can reuse a fixed cache but still require iterative rollout to construct it. We therefore propose RIFT (\emph{Rollout-free Imagination via Future Tokens}), which uses learned anticipation tokens to construct a complete future K/V cache in one backbone pass while retaining the original future-read interface. On LIBERO, RIFT achieves $98.8\%$ success, close to rollout-based Joint, IDM, and LingBot-VA at $98.4\%$ to $98.6\%$, while reducing action-chunk latency by $68.2\%$ to $89.1\%$. On RoboTwin~2.0, RIFT reaches $92.9/92.6\%$ on clean/randomized scenes, the highest observed among the evaluated methods. These results support rollout-free future conditioning without iterative video generation at deployment.