何が起きたか

2026年8月18日、arXivにプレプリント「GigaBrain-WBC-0.5: A Behavior World Model for Robust Whole-Body Control with Environment Interaction」が公開された。提案手法は、ヒューマノイドの全身運動追従ポリシーを、地形や物体との接触を考慮した世界モデルとして訓練するもので、Unitree G1で訓練したチェックポイントがMaker L01ロボットに簡単なファインチューニングで転移すると報告している。

詳細

論文によると、従来の全身追従ポリシーは平地のみで訓練され、地形や物体との接触がダイナミクスを変えることを学習しない。GigaBrain-WBC-0.5は、因果Transformerを用いて次の行動・次の状態・次の潜在行動コマンドの分布を同時に予測する。自動地形アノテーションパイプラインにより、既存のモーションデータセット規模での地形アノテーションを可能にした。展開時には予測分布を利用して非現実的なコマンドを検出し、学習済み行動に引き戻す。実験では、地形インタラクション成功率81.3%(最強ベースラインの4.3倍)、非現実的コマンド下で83.1%、転倒回復99.3%(同16.8倍)を達成した。ハードウェア試験では、支持欠落や外乱下での堅牢なインタラクションを示した。

Key Facts

GigaBrain-WBC-0.5は、ヒューマノイド全身制御のための初のBehavior World Model (BWM)であると論文は主張している。[1]
地形インタラクション成功率81.3%(最強ベースラインの4.3倍)、非現実的コマンド下で83.1%、転倒回復99.3%(同16.8倍)を達成。[1]
Unitree G1のチェックポイントは、Maker L01ロボットに簡単なファインチューニングで転移する。[1]
自動地形アノテーションパイプラインにより、既存のモーションデータセット規模での地形アノテーションを可能にした。[1]
因果Transformerが次の行動、次の状態、次の潜在行動コマンドの分布を同時に予測する。[1]

本紙の見方

今回の発表は、ヒューマノイドの全身制御における「環境との接触」を明示的にモデル化する点で新規性が高い。従来の追従ポリシーは平地のみを想定し、参照動作コーパスを拡大することで対応してきたが、環境依存の行動が増えると破綻する。GigaBrain-WBC-0.5は、行動・状態・潜在コマンドの分布を同時予測する世界モデルを導入し、地形接触の3D形状を自動アノテーションすることで、データセット規模での学習を可能にした。これは、単なる追従ではなく「環境が次に何を可能にするか」をモデル化する点で、制御パラダイムの転換といえる。 本紙の過去報道では、UnitreeのIPO後、ヒューマノイド業界で「第二のUnitree」を模索する動きを報じた。今回の論文は、Unitree G1で訓練したモデルが他社製ロボット(Maker L01)に転移可能であることを示しており、特定ハードウェアに依存しない制御基盤の可能性を示唆する。これは「第二のUnitree」を目指す新興企業にとって、制御ソフトウェアの共通化が競争の焦点になることを示す。 業界構造への含意として、制御モデルの汎用性が高まれば、ハードウェアの差別化が相対的に重要になる。一方で、世界モデルの学習には大量のモーションデータと地形アノテーションが必要であり、データの質と量が競争力を左右する。また、転移学習の容易さは、異なるロボット間でのソフトウェア移植を促進し、サプライチェーンにおけるソフトウェア層の重要性を高める。 未確定の論点として、論文はシミュレーションとハードウェア試験の結果を示すが、実運用での耐久性や計算コスト、転移先での性能劣化の程度は不明である。また、世界モデルの予測分布がどの程度正確に環境の変化を捉えるか、長期的な学習データの更新方法も焦点になる。

なぜ重要か

ヒューマノイド制御が「環境を理解する」段階に入ったことを示す。特定ハードウェアに依存しない制御基盤の登場は、業界の競争軸をハードからソフト・データへ移す可能性がある。