何が起きたか

arXivは2026-09-28付で、移動マニピュレーション向け基盤モデル「MM-ABC: Towards Generalist Mobile Manipulation via Seeing, Coordinating and Imagining」を公開した。モデルは、空間認識のための疎な多層VLM特徴、将来分岐による世界想像、腕とベースの動作を分けて調整するMM-APTを組み合わせる設計である。事前学習には5,000時間超の異種ロボットデータ、40万件超のエピソード、12データセット、17体制を用いた。

詳細

著者は、移動を含むロボット操作では、連続的な自己運動に伴う空間認識と、異種の腕・ベース動作の協調が課題だと位置づけている。MM-ABCは、Seeing、Coordinating、Imagining Arm-Base Collaborationを軸に、疎な多層VLM特徴で空間を捉え、学習時のみ使う将来分岐で世界想像と幾何学的意図を追加教師として利用し、MM-APTでマスク付きのjoint attentionとclean-action x-predictionにより動作ストリームを調整する。 実験はEBench、RoboCasa365、ManiSkill-HAB、LIBERO、LIBERO-Plus、実世界の移動マニピュレーションにまたがる。アブレーションでは、clean-action predictionをvelocity predictionに置き換えるとRoboCasa365 composite-seenの成功率が32.8%から29.2%に低下し、将来教師や多層条件を外すとより大きな低下が生じた。

Key Facts

arXivが2026-09-28付で「MM-ABC: Towards Generalist Mobile Manipulation via Seeing, Coordinating and Imagining」を公開した[1]
MM-ABCはSeeing、Coordinating、Imagining Arm-Base Collaborationを軸にした基盤モデルである[1]
事前学習は5,000時間超の異種ロボットデータ、40万件超のエピソード、12データセット、17体制で行われた[1]
実験対象はEBench、RoboCasa365、ManiSkill-HAB、LIBERO、LIBERO-Plus、実世界の移動マニピュレーションである[1]
RoboCasa365 composite-seenでは、clean-action predictionをvelocity predictionに置き換えると成功率が32.8%から29.2%に下がった[1]

本紙の見方

MM-ABCの新しさは、移動機構と操作機構を単に別系統で扱うのでなく、両者の協調を前提にした表現と学習信号を同時に設計した点にある。空間認識のための疎な多層VLM特徴、学習時のみの将来分岐、MM-APTによるマスク付きjoint attentionとclean-action x-predictionは、それぞれ単独の機能ではなく、自己運動しながら対象に接近し、把持や操作へ移る一連の流れを切らさないための構成と読める。 本紙の過去報道はないが、今回の発表は、移動マニピュレーションを「視覚認識」「計画の想像」「腕とベースの協調」という3層に分けて組み直している点で、従来の3D表現や予測世界モデル中心の発想とは異なる。しかも、アブレーションでvelocity predictionへの置換がRoboCasa365 composite-seenの成功率を32.8%から29.2%に下げたことから、問題は単なる行動出力の形式ではなく、行動の正規化と協調表現の結び方にある可能性が高い。将来教師や多層条件を外した場合の低下も示されており、性能の源泉は「大規模データを入れた」ことだけでは説明しきれない。 業界構造への含意は、データの種類とロボットの体制数が性能に直結している点にある。5,000時間超、40万件超、12データセット、17体制という学習条件は、単一ロボットや単一タスクの最適化では不足しうることを示している一方、実世界5課題で83%の平均成功率を出したことは、シミュレーション内の汎用性と実機移行の両方を視野に入れた設計だとみられる。次に確認すべきなのは、各ベンチマークでの個別スコア差、どの体制・タスクが性能に効いたのか、そして学習時にのみ使う将来分岐が実運用でどの程度再現可能かである。

なぜ重要か

移動しながら対象を扱うロボットでは、認識と操作を分けるだけでは足りないことが、今回のアブレーション結果から示唆される。RoboCasa365 composite-seenで32.8%から29.2%への低下が出たため、行動表現の選び方が性能に直接効く可能性がある。 著者は、5,000時間超の異種ロボットデータと17体制を使った事前学習が有効だとしており、単一機体・単一データでは捉えにくい協調挙動を学ばせる条件が重要になるとみられる。実世界5課題で83%の平均成功率を示した点は、実機適用を意識する研究にとって判断材料になる。