何が起きたか

arxiv.orgに2026年3月10日付で掲載された論文「SCDP: Learning Humanoid Locomotion from Partial Observations via Mixed-Observation Distillation」において、センサー条件付き拡散ポリシー(SCDP)が提案された。この手法は、オフラインデータセットからヒューマノイドの歩行制御を学習し、オンボードセンサーのみで動作する。シミュレーションでは速度指令追従で99〜100%の成功率、AMASSテストセットで93%の追従成功率を達成し、実機G1で50Hzでの動作が確認された。

詳細

SCDPは、拡散モデルがセンサー履歴に条件付けられ、特権的な未来の状態・行動軌跡を予測するよう教師される混合観測訓練を採用する。これにより、部分観測下での運動ダイナミクスの推論を強制する。さらに、制限付きデノイジング、コンテキスト分布アライメント、コンテキスト認識アテンションマスキングを開発し、モデル内での暗黙的な状態推定を促進し、訓練と展開のミスマッチを防ぐ。速度指令歩行と動作参照追従タスクで検証され、特権的なベースラインと同等の性能を示した。実機では外部センシングや状態推定なしで堅牢な歩行を実現した。

Key Facts

SCDPはオンボードセンサーのみでヒューマノイド歩行を実現し、明示的な状態推定を不要にする。[1]
シミュレーションで速度制御の成功率は99〜100%、AMASSテストセットでの追従成功率は93%を達成。[1]
実機G1で50Hzでの歩行を実証し、外部センシングや状態推定なしで堅牢な動作を確認。[1]
混合観測訓練により、拡散モデルはセンサー履歴に条件付けられ、特権的な未来の状態・行動軌跡を予測するよう教師される。[1]
制限付きデノイジング、コンテキスト分布アライメント、コンテキスト認識アテンションマスキングを開発し、訓練と展開のミスマッチを防ぐ。[1]

本紙の見方

本手法の新規性は、ヒューマノイド歩行制御において、従来必須とされてきた全身状態推定を排除し、オンボードセンサーの履歴のみから動作を生成する点にある。既存の手法は特権的な状態情報に依存し、実機展開時の状態推定の複雑さや信頼性が課題だった。SCDPは混合観測訓練により、センサー情報から暗黙的に状態を推定することを学習し、訓練と展開のギャップを縮める。これにより、シミュレーションと実機の両方で高い性能を示したことは、実用化への大きな一歩とみられる。 業界構造への含意として、このアプローチはヒューマノイドの制御パイプラインを簡素化し、高価な外部センシングや複雑な状態推定アルゴリズムへの依存を低減する可能性がある。これにより、コスト削減や堅牢性向上が期待され、ヒューマノイドの実用化を加速させる可能性がある。一方で、論文はシミュレーションと単一の実機での検証に留まっており、多様な環境や外乱に対する頑健性、長期的な安定性などは未確認である。また、学習データの多様性や計算資源の要件も今後の論点となる。 本紙の過去報道との接続はないが、この研究はヒューマノイド制御におけるセンサー情報の活用というトレンドの一環と位置づけられる。今後は、実機での長期運用試験や、異なるハードウェアへの適用可能性が焦点になるだろう。

なぜ重要か

この研究は、ヒューマノイドの歩行制御を簡素化し、実用化への障壁を下げる可能性がある。センサー情報のみで動作する制御手法は、コストと複雑さを低減し、より広範な応用を可能にする。今後の実証とスケーラビリティの検証が、業界への影響を左右するだろう。