何が起きたか
研究チームは2026年9月2日、arXivで「World-Model-Augmented Visual Locomotion for Humanoids on Foothold-Constrained Terrain」と題する論文を公開した。同論文は、Unitree G1ヒューマノイドに世界モデルとPPOポリシーを併用する「WM-LOCO」を実装し、飛び石・ギャップ・狭い階段などの足場制約地形で平均93.3%の成功率を達成したと報告している。シミュレーションでは、ベースラインが完全に失敗するギャップと飛び石で成功し、階段では成功率を維持しつつ歩幅効率を改善し、骨盤加速度を低減した。
詳細
WM-LOCOは、自己受容感覚と単一の搭載深度画像を条件として、リカレント世界モデルとPPOポリシーを共同訓練する。世界モデルは、明示的な足場ラベルなしに、予測的なリカレント特徴量を生成し、ポリシーを導く。実機では、Unitree G1に自己受容感覚と単一の深度ストリームを用いて同一ポリシーを展開し、3種類の地形すべてを平均成功率93.3%で横断した。
Key Facts
| 研究チームは2026年9月2日、arXivでWM-LOCOに関する論文を公開した。 | [1] |
| WM-LOCOは、リカレント世界モデルとPPOポリシーを共同訓練する手法である。 | [1] |
| 実機のUnitree G1は、自己受容感覚と単一の深度ストリームを用いて、3種類の地形すべてを平均成功率93.3%で横断した。 | [1] |
| シミュレーションでは、WM-LOCOはギャップと飛び石で成功し、ベースラインは完全に失敗した。 | [1] |
| 階段では、WM-LOCOはベースラインと同等の成功率を維持しつつ、歩幅効率を改善し骨盤加速度を低減した。 | [1] |
本紙の見方
今回の研究は、ヒューマノイドの歩行制御において、単なる運動能力ではなく「予測的な世界モデル」を組み込むことで、足場が不連続な地形での適応性を高める点に新規性がある。従来の視覚ベースの歩行制御は、即時的な地形情報に依存するため、飛び石やギャップのような一度の失敗が致命的な環境では脆弱だった。WM-LOCOは、近未来の観測と報酬の予測要約を学習することで、事前に足場を計画する能力を獲得しており、これは実世界の複雑な地形での応用可能性を示す。 本紙の過去報道では、ヒューマノイド競争の焦点が運動機能から実場景での作業能力へ移行し、データ収集が主戦場になっていると指摘した。今回の研究は、その流れに沿うものであり、単に歩くだけでなく、不整地での安定した移動が産業応用の前提となることを示す。また、Unitree G1が研究プラットフォームとして広く使われていることは、同社のハードウェアが研究コミュニティで標準的になりつつあることを示唆する。 業界構造への含意として、歩行制御の高度化は、ロボットの適用範囲を工場内の平坦な床から、建設現場や災害現場などの不整地へ拡大する可能性がある。これにより、ヒューマノイドの市場はより広い産業領域に広がるが、同時に制御アルゴリズムの優位性が競争力を左右するため、ソフトウェア開発力が重要になる。 未確定の論点としては、実機での成功率93.3%が、どのような環境条件(照明、床材、段差の高さなど)で達成されたのか、また、シミュレーションと実機のギャップがどの程度あるのかが挙げられる。さらに、世界モデルの学習に必要なデータ量や計算資源が明らかでないため、実用化に向けたスケーラビリティが焦点になる。
なぜ重要か
この研究は、ヒューマノイドが実世界の不整地を安定して歩行できる可能性を示し、産業応用の範囲を広げる一歩となる。Unitree G1が研究プラットフォームとして活用されることで、同社のハードウェアの信頼性が評価され、今後の量産・普及に寄与する可能性がある。