何が起きたか

arxiv.orgは2026-10-07、Long-WAM: Scaling the Context of World-Action Models を公開した。論文は、リアルタイム制御の制約下で世界行動モデルの文脈を拡張するモデル・システム枠組みを示し、Unitree G1とYAMでのリアルタイム実行を報告している。RoboCasa GR-1では、文脈を0.0秒から19.2秒へ増やすと成功率が63.3%から78.7%に上がったとしている。

詳細

論文は、まずロボット映像と一人称映像から行動ラベルなしで因果予測を学び、その後に履歴から未来への構造を保ったまま世界行動モデルへ適応させる手順を採用したとしている。画像履歴のストリーミング符号化、非同期実行、ハードウェア固有の加速により、RTX 5090、DGX Spark、Jetson AGX Thor上で未来予測を落とさずに動作させたとしている。 RTX 5090では、未来動画の潜在予測を含む各アクションチャンクの処理時間は107.4 msとされる。比較対象では、Long-WAMはLIBERO-Long、RoboTwin 2.0、DOMINOで最良結果を示したとしている。動的なカップ積みでは95%の成功率を示し、Pi0.5とFast-WAMは20試行で成功しなかったとしている。

Key Facts

Long-WAM: Scaling the Context of World-Action Models が2026-10-07にarxiv.orgで公開された[1]
RoboCasa GR-1で文脈を0.0秒から19.2秒に増やすと成功率が63.3%から78.7%に上昇したとされる[1]
RTX 5090、DGX Spark、Jetson AGX Thor上で未来予測を落とさずに動作させたとしている[1]
RTX 5090では、各アクションチャンクの処理時間が107.4 msとされる[1]
Unitree G1とYAMでリアルタイム実行を示し、動的カップ積みで95%の成功率を示したとしている[1]

本紙の見方

Long-WAMの新しさは、単に長い履歴を入れた点ではなく、履歴を未来予測にどう接続するかをモデル設計と実行系の両方で扱っている点にある。論文は、履歴を使えばよいのではなく、事前学習の型が長文脈の効き方を左右すると位置づけている。RoboCasa GR-1で0.0秒から19.2秒への拡張が63.3%から78.7%につながった一方、双方向事前学習の初期化では純増が見られなかったとしており、文脈長そのものより、因果的な履歴→未来の表現を保てるかが焦点だと読める。 本紙の関連記事であるFigure AI、F.02を溶解処分と報道 BMW工場で11カ月稼働が示したのは、実機導入の評価軸が「派手な性能」よりも継続稼働の実績に移っていることだった。これに対しLong-WAMは、Unitree G1とYAMでのリアルタイム実行と、動的カップ積み95%というタスク結果を並べ、研究用ベンチマークと実機運用の橋を意識した構成になっている。つまり、単発の識別精度ではなく、長い履歴を保ちながら遅延を抑えて実行できるかが、ロボット基盤モデルの比較軸になりつつある。 業界構造としては、論文がRTX 5090、DGX Spark、Jetson AGX Thorという複数の計算基盤を挙げている点が重要である。これは、同じモデルでも学習・推論・組み込み実装の境界で要件が変わることを示し、アルゴリズム単体ではなく実行スタック全体の最適化が競争点になることを示唆する。さらに、future-video latent predictionを含む各アクションチャンクが107.4 msという数値は、長文脈化がそのまま遅延増につながるわけではない一方、実時間制御の余裕がまだ限定的であることを示す。加えて、Long-WAMがLIBERO-Long、RoboTwin 2.0、DOMINOで最良結果を示したとしても、どの作業カテゴリでどこまで一般化するかは別問題であり、次に確認すべきはタスク範囲、成功率の分散、学習に使った映像の構成、そしてUnitree G1とYAM以外の機体での再現性である。

なぜ重要か

論文がUnitree G1とYAMでのリアルタイム実行を示したことは、研究室内の検証にとどまらず、実機制御に耐える時間設計が論点になっていることを示す。RTX 5090、DGX Spark、Jetson AGX Thorという異なる計算環境をまたいで動作したとする点からも、ロボット基盤モデルではモデル性能だけでなく計算資源との適合が重要だと読める。

日本への影響

日本企業や研究機関にとっては、長文脈の世界行動モデルを実機に載せる際に、学習用映像の収集と、Jetson AGX Thorのようなエッジ実装をどうつなぐかが論点になるとみられる。Unitree G1とYAMでの結果は、ロボット本体よりも、履歴処理・非同期実行・加速実装を含むソフトウエア層の設計力が競争力になりうることを示している。