何が起きたか
arXivに投稿された論文「Keep the Future, Drop the Rollout: RIFT for World Action Models」において、世界行動モデル(WAM)の推論時における反復的なビデオロールアウトを不要にする手法RIFT(Rollout-free Imagination via Future Tokens)が提案された。研究チームは、行動生成に必要なのは進化するロールアウト軌跡そのものではなく、その将来表現のみであると問いかけた。4つのWAMをLIBEROの全40タスクで評価し、ペアの閉ループ介入実験により、将来キャッシュの値をマスクまたは再割り当てすると実行が変化し成功率が低下することを確認した。一方、JointとCosmos-2では、固定された最終クリーンなK/Vキャッシュを再生することで、未変更の実行にほぼ近い性能を維持し、エンドエフェクタの平均変位誤差は1.7〜1.9cm、成功率は97.9%〜98.2%だった。これにより、キャッシュの消費と生成が分離可能であることが示された。RIFTは、学習された予測トークンを用いて、元の将来読み取りインターフェースを維持しながら、1回のバックボーンパスで完全な将来K/Vキャッシュを構築する。LIBEROでは成功率98.8%を達成し、ロールアウトベースのJoint、IDM、LingBot-VA(98.4%〜98.6%)に匹敵し、行動チャンクの遅延を68.2%〜89.1%削減した。RoboTwin 2.0では、クリーン/ランダム化シーンで92.9%/92.6%の成功率を達成し、評価された手法の中で最高だった。
Key Facts
| 世界行動モデル(WAM)は予測された未来にロボットの行動を条件付けるが、反復的なビデオロールアウトが展開時の遅延を増加させる。 | [0] |
| 研究チームは、行動生成に必要なのは進化するロールアウト軌跡ではなく、その将来表現のみであると問いかけた。 | [0] |
| 4つのWAMをLIBEROの全40タスクで評価し、ペアの閉ループ介入により、将来キャッシュの値をマスクまたは再割り当てすると実行が変化し成功率が低下することを確認した。 | [0] |
| JointとCosmos-2では、固定された最終クリーンなK/Vキャッシュを再生することで、未変更の実行にほぼ近い性能を維持し、エンドエフェクタの平均変位誤差は1.7〜1.9cm、成功率は97.9%〜98.2%だった。 | [0] |
| RIFTは、学習された予測トークンを用いて、元の将来読み取りインターフェースを維持しながら、1回のバックボーンパスで完全な将来K/Vキャッシュを構築する。 | [0] |
| LIBEROでは、RIFTは成功率98.8%を達成し、ロールアウトベースのJoint、IDM、LingBot-VA(98.4%〜98.6%)に匹敵し、行動チャンクの遅延を68.2%〜89.1%削減した。 | [0] |
| RoboTwin 2.0では、RIFTはクリーン/ランダム化シーンで92.9%/92.6%の成功率を達成し、評価された手法の中で最高だった。 | [0] |
なぜ重要か
この研究は、ロボット行動モデルの展開時におけるビデオ生成の反復処理を不要にすることで、推論遅延を大幅に削減できる可能性を示している。RIFTは、将来の表現を1回のパスで構築するため、実時間でのロボット制御に有用である。