何が起きたか
arXivは2026年9月28日、ヒューマノイドのロコマニピュレーション向け離散VLAモデル「Holo-M」を掲載した。論文は、従来のロボットアーム向け離散アクション・トークンの枠を、脚・胴体・腕・手を含む全身制御に拡張した点を新規性としている。著者らは、SIMPLEヒューマノイド・ロコマニピュレーション・ベンチマークで一般汎化評価と専門評価の双方で最高の成功率を得たとしている。
詳細
論文は、ヒューマノイドの行動空間を end-effector、body、hand、kinematics の4種類の部位別トークナイザに分解する統一アクション・トークナイザを提案している。学習データは、ヒューマノイドの遠隔操作、egocentric human video、simulation を含む複数の異なる身体形態・データ源にまたがるとしている。 推論では、アクション・トークンを自己回帰ではなく grouped discrete diffusion decoding で復号し、実時間制御要件に対応するとしている。著者らは、コードとモデル重みを公開するとしている。
Key Facts
| arXivに「Humanoid Loco-Manipulation With Discrete VLA Model」が掲載された(2026-09-28)。 | [1] |
| 論文は「Holo-M」を、ヒューマノイド向け離散VLAモデルとして提示している。 | [1] |
| 行動空間を end-effector、body、hand、kinematics の4種のトークナイザに分ける統一アクション・トークナイザを提案している。 | [1] |
| 学習対象に humanoid teleoperation、ego-centric human video、simulation を含めている。 | [1] |
| SIMPLE humanoid loco-manipulation benchmarkで、generalist と specialist の両評価で最高の成功率を得たとしている。 | [1] |
本紙の見方
Holo-Mの新しさは、ヒューマノイドの全身制御を、言語モデルの語彙拡張と離散アクション・トークンの枠組みで扱おうとした点にある。従来のVLAモデルが腕の操作を中心に成果を出してきたのに対し、この論文は脚、胴体、腕、手を同時に扱うためのトークナイズと復号を設計している。つまり、課題の中心は『認識を持つモデル』ではなく、『異質な全身アクション空間をどう共通表現に落とすか』に置かれている。 構造として見ると、入力は humanoid teleoperation、ego-centric human video、simulation であり、処理系は4種の部位別トークナイザ、出力は grouped discrete diffusion decoding による実時間制御である。ここで重要なのは、連続値の専門家モデルを別々に積むのではなく、言語モデルの語彙に行動トークンを組み込んでいる点だ。論文はこれにより knowledge-insulation problem を避けるとしており、全身制御の表現学習と推論経路を一体化しようとしている。これは、ヒューマノイドに必要な多自由度制御を、アーキテクチャ分離ではなく共通語彙で束ねる設計だと読める。 本紙の観点では、今回の論文はヒューマノイド制御における『マニピュレーションの延長』と『全身ロコマニピュレーションの固有課題』を切り分けた事例である。SIMPLEベンチマークで最高成績を主張しているが、ベンチマークが実機の転倒耐性や長時間連続動作、未学習タスクまでどこまで含むかは本文だけでは追い切れない。したがって、次に確認すべき論点は、コードと重みの公開後に再現性がどこまで担保されるか、4部位のトークナイザが実機でどの程度汎化するか、そして grouped discrete diffusion decoding がレイテンシと成功率の両立にどこまで効くかである。
なぜ重要か
論文は、ヒューマノイドの脚・胴体・腕・手を一つの離散VLA枠組みで扱う設計を示しているため、全身制御を学習させる研究者にとって、表現設計と推論設計の両面で比較対象になりうる。著者らがコードとモデル重みを公開するとしている点も、再現実験や別の身体構成への移植を検証する前提になる。
日本への影響
ヒューマノイド制御で脚、胴体、腕、手を分けて離散化する発想は、日本のロボット研究でも、上半身マニピュレーションと歩行制御を別系統で扱ってきた構成を見直す論点になりうる。もっとも、論文が示したのはベンチマーク上の結果であり、実機の制御基盤や学習データの整備がどこまで必要かは、公開後の再現で確認されるべきだ。