何が起きたか
arxiv.orgは2026年9月11日、論文「DWMP: Leveraging Dual World Models for Humanoid Obstacle Traversal」を掲載した。論文は、Unitree G1ヒューマノイド上で、固有感覚と自車視点の深度観測を別個の世界モデルで処理するDWMP(Dual World Model Policy)を提案した。実験はシミュレーションと実機で行われ、障害物走破性能が既存手法を上回ったとしている。
詳細
DWMPは、固有感覚をKoopmanベースの動力学世界モデルで潜在空間に写像し、時間発展を近似的に線形化する構成である。視覚側はRSSMベースの世界モデルで自車視点の深度観測を圧縮し、障害物の幾何情報を保ちながら確率状態として扱う。最終的にstudent policyが、線形化した動力学表現と圧縮した視覚表現を融合した潜在表現から行動を生成する。論文は、ランダム化した障害物配置の下でも現実環境への展開を支えたとしている。
Key Facts
| arxiv.orgは2026年9月11日、論文「DWMP: Leveraging Dual World Models for Humanoid Obstacle Traversal」を掲載した。 | [1] |
| 論文は、Unitree G1ヒューマノイドを使った実験を行った。 | [1] |
| DWMPは、固有感覚向けのKoopmanベース動力学世界モデルと、自車視点深度観測向けのRSSMベース視覚世界モデルを分けて扱う。 | [1] |
| student policyは、融合した潜在表現から行動を生成する。 | [1] |
| 論文は、シミュレーションと実機で障害物走破性能の改善を示したとしている。 | [1] |
本紙の見方
今回の論文の新しさは、ヒューマノイドの障害物走破を、単一の多モーダル処理ではなく「固有感覚の動力学」と「視覚の幾何」を分離して学習させる点にある。Koopmanベースで自己状態の時間発展を近似的に線形化し、RSSMで深度観測を圧縮するため、入力の性質に応じて表現を分けている。ここが単なるセンサ融合ではなく、ロボットの運動と視覚を別々の世界モデルに落としてから統合する構造である。 本紙の関連記事である humanoid.guide、Unitree G1向けBeyondMimicを報道 や humanoid.guide、Unitree G1の分解記事を報道 アクチュエータと冷却設計に焦点 と合わせると、Unitree G1は外形や部品の議論にとどまらず、実機上での学習・制御の検証台としても扱われていることが分かる。今回の論文は、その延長線上でG1を障害物走破の実験機として用いたものであり、機体のハード情報とソフトの制御研究が別々ではなく結びついている点が示唆される。 業界構造への含意としては、障害物回避を「エンドツーエンドの模倣学習」だけで扱うのではなく、動力学モデルと視覚モデルに分けて学習する設計が有効かどうかが焦点になる。とくに、深度観測を圧縮しても障害物の幾何を保てるか、また線形化した自己状態表現が実機の非線形動作にどこまで耐えるかが重要である。ここが崩れればシミュレーションでの性能と実機展開の差が残る可能性がある。 未確定の論点は、実機での具体的な成功率、比較したベースラインの種類、計算負荷、学習データの規模、そしてランダム化した障害物配置の詳細である。論文要旨だけでは、DWMPがUnitree G1以外のヒューマノイドにそのまま移植できる条件までは読めない。
なぜ重要か
論文が示したのは、ヒューマノイドの障害物走破で、自己状態と視覚を同じ扱いにせず分けて学習する設計が実機で検証された点である。Unitree G1を使ったシミュレーションと実機の両方で性能改善を示したとしており、制御方式の選択が機体性能だけでなく学習表現の設計に依存することが具体化したといえる。
日本への影響
Unitree G1が実機検証に使われたことで、日本のヒューマノイド研究でも、機体そのものだけでなく障害物走破の表現学習や世界モデル設計を評価対象に含める必要がある。とくに、深度観測と自己状態を別系統で扱う構成は、センサー統合や制御ソフトの設計に強みを持つ研究開発に関係する。