何が起きたか

RoboDreamerは2026年9月7日、予測状態空間モデルを使うヒューマノイド歩行制御手法として公表された。論文は、クリーンな観測で教師モデルを学習した後、直近の観測をランダムに欠く形で学生モデルを蒸留する二段階のteacher-student構成を採る。推論時には同じマスキング・インターフェースを閉ループの動作補正と任意のマルチステップ動作チャンクに再利用する。

詳細

論文では、時間方向のバックボーンとしてMambaを用いている。著者らは、マスキングと蒸留が性能向上の大きな部分を担い、Mambaが実時間遅延を保ちながら追従性能をさらに改善するとしている。 実験はIsaacLab、MuJoCo、Unitree G1で行われ、観測マスキング下での堅牢なモーション追従と、実機でのデプロイ成功が示された。

Key Facts

RoboDreamerは予測状態空間モデルを用いるヒューマノイド歩行制御手法である。[0][1]
教師モデルをクリーンな観測で学習し、学生モデルをランダムな連続時間マスキング下で蒸留する二段階構成を採る。[0][1]
推論時には同じマスキング・インターフェースを閉ループの動作補正に再利用し、任意のマルチステップ動作チャンクも行える。[0][1]
時間方向のバックボーンにはMambaを用いる。[0][1]
実験はIsaacLab、MuJoCo、Unitree G1で行われ、実機デプロイ成功が示された。[0][1]

本紙の見方

今回の論文で新しいのは、観測欠損を前提にした制御学習を、teacher-student蒸留と推論時の同一マスキング・インターフェースまで一体化して設計している点である。単に履歴を入れる、あるいは一段の方策を学ぶだけではなく、直近観測を意図的に欠かせた状態で学生を鍛え、そのまま推論時の閉ループ補正に流用しているため、学習と実行の境界を狭める構造になっている。 本紙の関連記事である 王興興氏、具身知能の到達条件を数値で示す王兴兴氏、WRC 2026でロボットの自進化を語る と合わせると、宇樹科技周辺では「高次の知能」そのものより、まず実機で崩れにくい制御と自己修正の枠組みが重要テーマになっていることが見える。RoboDreamerはその議論を、抽象論ではなくUnitree G1という具体機体とIsaacLab、MuJoCoというシミュレーション環境に落として検証した点に意味があるとみられる。 業界構造としては、ヒューマノイドの性能競争がハードウェア単体から、観測欠損に耐える制御系、シミュレーション、実機検証の往復に移っていることを示す材料である。Mambaの採用は、長い時系列を扱いながら実時間遅延を抑える設計上の選択であり、制御モデルのアーキテクチャ選定が実機導入可否に直結しつつあることを示唆する。なお、論文要旨だけでは、Unitree G1上での具体的な成功条件、比較対象、失敗時の挙動、マルチステップ動作チャンクの効果量は読み切れない。今後は、どの程度の観測欠損率まで安定するのか、既存手法との差がどのタスクで出たのか、実機での遅延と安全性をどう評価したのかが焦点になる。

なぜ重要か

観測が欠けても動作を保つ制御が実機で成立するなら、ヒューマノイドの現場適用で問題になりやすいセンサーの不完全さや一時的な観測乱れへの耐性を評価しやすくなる。論文がUnitree G1での実機デプロイ成功を示したことは、シミュレーションだけでなく実機検証を前提にした制御設計が必要であることを裏づける。

日本への影響

日本企業や研究機関にとっては、ヒューマノイドの機体性能だけでなく、観測欠損に耐える学習手法と実機評価環境の整備が競争力の一部になる可能性がある。特に、実機デプロイを前提とするなら、制御ソフト、シミュレーション、検証機体をつなぐ体制の有無が差になりやすい。