何が起きたか
arxiv.orgに2026年6月10日付で掲載された論文『Critic Architecture Matters: Dual vs. Unified Critics for Humanoid Loco-Manipulation』が、Unitree G1(23の能動自由度、うち17がポリシー制御)を用いた実験で、複数の報酬を分離した批判的構成(デュアル)が統合型(ユニファイド)より高い到達率を示したと報告した。
詳細
論文は、NVIDIA Isaac Lab環境で、据え置きから可変方向ターゲットへの歩行までの逐次カリキュラムを用いて訓練した。同一計算予算の下で、デュアル批判はユニファイド批判より3.5倍速くターゲットに到達(6.5対22.6シミュレーションステップ)、1,000ステップあたりの検証到達数は2倍(14.3対7.0)、検証到達率は65.2%対53.8%だった。デュアル批判に5つのアンチゲーミング報酬機構を追加しても改善は見られなかった(60.9%対65.2%)。論文は、この差を批判的構成の単独効果ではなく、訓練された2つのポリシー間の効率ギャップとして報告しており、カリキュラムスケジュールやアーム行動次元などの違いも指摘している。
Key Facts
| 論文はUnitree G1(23の能動自由度、うち17がポリシー制御)をNVIDIA Isaac Labで使用した。 | [1] |
| デュアル批判はユニファイド批判より3.5倍速くターゲットに到達(6.5対22.6シミュレーションステップ)。 | [1] |
| デュアル批判は1,000ステップあたり14.3回の検証到達で、ユニファイド批判の7.0回の2倍。 | [1] |
| デュアル批判の検証到達率は65.2%で、ユニファイド批判の53.8%を上回った。 | [1] |
| デュアル批判に5つのアンチゲーミング報酬機構を追加しても到達率は60.9%に低下した。 | [1] |
なぜ重要か
ヒューマノイドロボットの実用化には、移動と操作の統合制御が不可欠であり、その学習効率を左右する設計変数の理解は業界全体の進歩に直結する。今回の論文は、批判的構成という比較的軽視されがちな要素が性能に影響し得ることを示し、今後の研究開発の方向性に一石を投じるものだ。