何が起きたか

研究チームは2026年8月20日、脚式移動マニピュレーション向けの全身世界行動モデル「DECOWAM」を発表した。DECOWAMは、既存の世界行動モデルが固定ベースプラットフォーム向けに開発され、カメラの自己運動とベース・アーム動作を明確に区別していない問題に対処する。専用の条件付けインターフェースを通じてこれらの要素を分離し、適応済みFastWAMバックボーンを凍結して残差アダプターを訓練する。実ロボットデータセット「ARMDOG」を導入し、ビデオ、全身状態、動作、言語を同期させた。固定リプレイプロトコルでは、FastWAMと比較して動作予測のMSEを21.7%削減し、訓練可能な適応パラメータは25.95M。79回の閉ループ試験では、全身協調とベース変位ロバスト性で比較システム中最高を達成した。

詳細

DECOWAMは、凍結したFastWAMバックボーンに残差アダプターを訓練し、特権観測から蒸留したアクション等価未来ボトルネック、敵対的に分離されたベースとアームの潜在変数、ビデオ予測のためのベース速度条件付けを導入する。ARMDOGは、ビデオ、全身状態、動作、言語を同期させた実ロボットデータセット。固定リプレイプロトコルでは、DECOWAMはFastWAMと比較して将来ビデオと動作予測の両方を改善し、動作MSEを21.7%削減した。訓練可能な適応パラメータは25.95M。79回の閉ループ試験では、タスク完了率は最強のベースラインと同等でありながら、全身協調とベース変位ロバスト性で最高の観測値を達成した。

Key Facts

DECOWAMは、脚式移動マニピュレーション向けの全身世界行動モデルであり、カメラの自己運動とベース・アーム動作を分離する。[1]
DECOWAMは、適応済みFastWAMバックボーンを凍結し、残差アダプターを訓練する。[1]
DECOWAMは、固定リプレイプロトコルでFastWAMと比較して動作MSEを21.7%削減し、訓練可能な適応パラメータは25.95M。[1]
実ロボットデータセット「ARMDOG」は、ビデオ、全身状態、動作、言語を同期させる。[1]
79回の閉ループ試験で、DECOWAMは全身協調とベース変位ロバスト性で最高の観測値を達成し、タスク完了率は最強のベースラインと同等だった。[1]

本紙の見方

DECOWAMの発表は、移動マニピュレーションにおける世界行動モデルの設計に新たな視点を提供する。従来の世界行動モデルは固定ベースプラットフォーム向けに開発され、カメラの自己運動とベース・アーム動作を明確に区別していなかった。DECOWAMは、これらの要素を専用の条件付けインターフェースで分離することで、移動視点下での視覚予測と全身制御をパラメータ効率的に実現する。 本モデルの核心は、凍結したFastWAMバックボーンに残差アダプターを訓練する点にある。これにより、25.95Mの訓練可能パラメータで動作MSEを21.7%削減した。これは、大規模な再学習を避けつつ、移動プラットフォーム特有の課題に対処する手法として注目される。また、特権観測から蒸留したアクション等価未来ボトルネックや、敵対的に分離されたベースとアームの潜在変数は、全身協調を改善するための新しいメカニズムである。 実ロボットデータセットARMDOGの導入も重要だ。ビデオ、全身状態、動作、言語を同期させたデータセットは、移動マニピュレーション研究の基盤となる。79回の閉ループ試験で、タスク完了率を維持しつつ全身協調とベース変位ロバスト性で最高を達成したことは、実世界での適用可能性を示唆する。 一方で、未確定の論点もある。DECOWAMの性能は特定のリプレイプロトコルと閉ループ試験に基づいており、他の環境やタスクでの汎用性は不明である。また、ARMDOGの規模や多様性、学習データのバイアスも今後の検証が必要だ。さらに、FastWAMバックボーンの適応方法や、他のベースモデルへの適用可能性も未検証である。 業界構造への含意として、移動マニピュレーションの世界行動モデルは、固定ベースのモデルとは異なる設計を要することを示した。これは、ロボットの全身制御と視覚予測を統合する研究の方向性に影響を与える。特に、パラメータ効率的な適応手法は、計算資源が限られた実機への展開に有利である。

なぜ重要か

DECOWAMは、移動マニピュレーションにおける世界行動モデルの設計を前進させ、カメラの自己運動と動作の分離が性能向上に寄与することを実証した。これは、実世界のロボットが移動しながら物体を操作する際の予測と制御の精度向上につながる。また、ARMDOGデータセットは、今後の研究の共通基盤として活用される可能性がある。