日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
移動操作arXiv:2608.04657

MobileWAM: 世界行動モデルをチェーン・オブ・フォーサイトで移動操作に橋渡しする

MobileWAM: Bridging World Action Models to Mobile Manipulation with Chain-of-Foresight

シェア:XThreadsFacebookLINEはてブBluesky

移動操作のための世界行動モデルを提案し、事前学習済みのビデオ拡散トランスフォーマーと軽量な行動エキスパートを融合させ、移動と操作の異種ダイナミクスを扱う。また、中間表現が未来の潜在チャンクを逐次予測するCoFを導入し、実機でも高い性能を示した。

詳しい要約

1. どんなもの?

MobileWAMは、ビデオ生成バックボーンに基づくWorld Action Models (WAMs)を移動操作タスクに拡張するためのアーキテクチャとトレーニング手法を提案する。移動操作は、シーンスケールのダイナミクスの中で移動と全身操作を同時に要求するが、従来のWAMsはテーブルトップ操作に限定されていた。MobileWAMは、事前学習済みのビデオ拡散トランスフォーマーと軽量なアクションエキスパートを層ごとのジョイントアテンションで融合するmixture-of-transformersアーキテクチャを導入し、インターネット規模のモーションプライアを全身制御に変換する。さらに、中間表現が将来の潜在チャンクの連鎖を逐次予測するChain-of-Foresight (CoF)を提案し、ビデオとアクションの分離されたデノイジングスキームと組み合わせる。推論時には、WAMは純粋な現在フレームエンコーダとして機能し、フォアサイトチェーンとビデオ生成は破棄されるため、ポリシーレベルのコストのみが残る。

2. 先行研究と比べてどこがすごい?

先行研究のWAMsはテーブルトップ操作に限定されており、移動操作のシーン規模のダイナミクスや全身調整に対応できなかった。また、移動操作の既存手法はダイナミクスを考慮しない視覚エンコーダと手作りの調整に依存していた。MobileWAMは、事前学習済みのビデオ拡散トランスフォーマーを活用して移動操作に適用し、移動と操作の異種ダイナミクスを調和させるために、アクションエキスパートの各フィードフォワード層を共有・移動・操作の3エキスパートのmixture-of-expertsにすることで、モーションインテントに基づくソフトなルーティングを実現している点が新しい。また、CoFによる中間表現の密な監視は、ビデオとアクションの分離デノイジングと自然に組み合わさる。

3. 技術・手法の肝は?

手法の核は、1) mixture-of-transformersアーキテクチャ:事前学習済みのビデオ拡散トランスフォーマーと軽量なアクションエキスパートを層ごとのジョイントアテンションで融合し、インターネット規模のモーションプライアを全身制御に変換する。2) アクションエキスパートの各フィードフォワード層を3エキスパート(共有、移動、操作)のmixture-of-expertsにし、アクショントークンのモーションインテントによってソフトにルーティングする。3) Chain-of-Foresight (CoF):中間表現が将来の潜在チャンクの連鎖を逐次予測し、各ステップは前のステップに条件付けられる。これにより監視を密にする。4) デプロイ時には、WAMは純粋な現在フレームエンコーダとして機能し、フォアサイトは勾配を通じてのみ作用するため、推論時にはフォアサイトチェーンとビデオ生成は破棄され、ポリシーレベルのコストのみが残る。

4. どうやって有効だと検証した?

有効性は、ManiSkill-HABベンチマークでの最先端の移動操作ポリシーとの比較と、実機のARX Lift2移動マニピュレータへのファインチューニングによって検証された。多様なタスクで強い汎化を示したと報告されている。具体的な数値や比較の詳細は要旨からは不明。

5. 議論はある?

要旨からは、提案手法が移動操作におけるWAMsの適用範囲を拡張し、既存手法を上回る性能を示したことが議論の中心である。しかし、CoFの計算コストや、ビデオ生成を破棄することによる潜在的な限界、実機での汎化の限界などについては要旨からは不明。また、mixture-of-expertsのルーティングの解釈性や、異なるモーションプライアの影響についての議論も要旨には含まれていない。

6. 次に読むべき論文は?

要旨で参照されている関連研究として、World Action Models (WAMs)の基盤となるビデオ生成バックボーンを用いたロボット学習の研究、およびManiSkill-HABベンチマークで比較された最先端の移動操作ポリシーが挙げられる。具体的な論文名は要旨にないため、同分野の定番として、ビデオ生成に基づく世界モデルや、移動操作のための視覚エンコーダと制御ポリシーに関する研究を読むことが推奨される。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Zehua Fan, Junjie He, Wenxuan Song, Xi Wang, Wenqi Lyu, Linge Zhao, Fuhao Li, Zihan You, Yifei Yang, Kaiming Xu, Qi Jiang, Yue Jiang, Haoang Li, Cheng Chi, Feng Gao, Bailin Li, Yan Wang

分類: cs.CV

原文アブストラクト

World action models (WAMs) built on video generation backbones are a rising recipe for robot learning, yet remain confined to tabletop manipulation. Mobile manipulation demands simultaneous locomotion and whole-body manipulation amid scene-scale dynamics, yet is still dominated by dynamics-blind visual encoders with hand-crafted coordination. We bridge this gap with MobileWAM, a mixture-of-transformers architecture that fuses a pretrained video diffusion transformer with a lightweight action expert through layerwise joint attention, translating internet-scale motion priors into whole-body control. To reconcile the heterogeneous dynamics of moving and manipulating, each feed-forward layer of the action expert becomes a three-expert mixture of shared, locomotion, and manipulation experts, softly routed by the motion intent in the action tokens. To densify supervision, we further propose Chain-of-Foresight (CoF): intermediate representations sequentially predict a chain of future latent chunks, each step conditioned on its predecessor. CoF pairs naturally with our decoupled video--action denoising scheme. At deployment, the WAM serves as a pure current-frame encoder; foresight acts only through gradients, so at inference the foresight chain and video generation are discarded, leaving only policy-level cost. MobileWAM surpasses state-of-the-art mobile manipulation policies on ManiSkill-HAB and fine-tunes to a real ARX Lift2 mobile manipulator across diverse tasks with strong generalization. Code will be released soon.

関連論文