何が起きたか

2026年6月8日にarXivで公開された論文で、世界行動モデル(WAM)の推論を高速化する手法「C$^3$ache」が提案された。この手法は、複数の推論チャンク間で残差をキャッシュして再利用することで、総壁時計推論時間を最大2.5倍高速化し、タスク成功率の低下は無視できる程度と報告されている。

詳細

C$^3$acheは、学習を必要としない(training-free)手法で、WAMの推論時に複数のチャンクにまたがって同じデノイジングステップの残差をキャッシュし再利用する。既存の高速化手法は単一チャンク内のデノイジング軌跡に焦点を当てていたが、チャンク間の冗長性を見落としていた。実験ではFast-WAMバックボーンを用いたベンチマークで、総壁時計推論時間が最大2.5倍の高速化を達成し、タスク成功率の低下は無視できる程度だった。

Key Facts

C$^3$acheは学習不要の手法で、WAMの推論を高速化する。出典一覧
C$^3$acheは複数の推論チャンク間で残差をキャッシュし再利用する。出典一覧
Fast-WAMバックボーンを用いたベンチマークで、総壁時計推論時間を最大2.5倍高速化した。出典一覧
タスク成功率の低下は無視できる程度である。出典一覧

本紙の見方

本手法の新規性は、WAMの推論における冗長性を「チャンク間」に見出した点にある。既存の高速化手法は単一チャンク内のデノイジング軌跡に焦点を当てており、チャンク間の相関を利用する発想はなかった。C$^3$acheは学習不要で既存モデルにそのまま適用できるため、実用上のハードルが低い。 WAMはビデオモデリングの目的関数により、ラベル付きロボットデモではなく豊富な未ラベルビデオから学習できるため、汎化性能が高い一方、推論コストが高いという課題があった。本手法はその課題を直接的に緩和するものであり、ロボット学習の実用化に向けた重要な一歩とみられる。 業界構造への含意としては、推論コストの削減はエッジデバイスでの展開やリアルタイム制御の可能性を広げる。特に、クラウド依存を減らし、オンデバイスでの推論を可能にする点で、ロボットの自律性向上に寄与する可能性がある。 未確定の論点としては、実験で使用されたベンチマークの規模や多様性、他のWAMアーキテクチャへの適用可能性、実際のロボットタスクでの効果が挙げられる。また、キャッシュのメモリ消費や実装上のオーバーヘッドも検証が必要である。

なぜ重要か

WAMの推論コストは実用化の大きな障壁であり、C$^3$acheは学習不要で最大2.5倍の高速化を実現する。これにより、ロボットのリアルタイム制御やエッジ展開が現実味を帯び、ロボット学習の応用範囲が広がる可能性がある。