何が起きたか
arXivは2026年10月8日、人型ロボット向けのHumanoid World Action Model With Joint State--Action Generationを掲載した。論文は、参照行動と実行後の身体状態を同時に生成するHWAMを提案している。LimX OLIの実機3課題で評価し、Candy Pickingでは成功率70.6%を記録したとした。
詳細
HWAMは、現在の観測のみを条件に状態と行動の軌跡を同時にノイズ除去するPolicy path、行動と実行後状態を条件に未来の視覚観測を予測するForward Dynamics Modeling(FDM)、視覚遷移から関節軌跡を再構成するInverse Dynamics Modeling(IDM)の3経路で学習する。論文は、VLAや従来のWAMでは参照行動と実際の動作の間にずれが生じるため、実行された身体状態を明示的に扱う必要があると位置づけている。 評価はLimX OLI humanoid上で行われ、Candy PickingではHWAMが70.6%、Fast-WAMが43.3%だった。論文は、3つの実ロボット課題のうち少なくともCandy Pickingで最高成功率を示したとしている。
Key Facts
| arXivは2026年10月8日、Humanoid World Action Model With Joint State--Action Generationを掲載した。 | [1] |
| 論文はHumanoid World Action Model(HWAM)を提案し、実行後の固有受容状態を明示的な予測対象に含めた。 | [1] |
| HWAMはPolicy path、Forward Dynamics Modeling(FDM)、Inverse Dynamics Modeling(IDM)の3経路で学習する。 | [1] |
| 評価はLimX OLI humanoidで行われ、3つの実ロボット課題が対象だった。 | [1] |
| Candy PickingではHWAMの成功率が70.6%で、Fast-WAMの43.3%だった。 | [1] |
本紙の見方
この論文の新規性は、人型ロボットの方策を「次の行動」だけでなく「行動後に実際にどう動いたか」という固有受容状態まで同時に学習対象に置いた点にある。従来のVLAやWAMは参照行動の生成に重心があったが、ここでは実行段階のずれそのものをモデル設計に取り込んでいる。したがって、単なる精度向上の話というより、計画と制御の間にあるギャップをどう埋めるかという設計論の提案である。 本紙の関連記事はないため、過去報道との連続性は置けない。ただし論文本文からは、HWAMがPolicy path、FDM、IDMの3経路を組み合わせていることが分かる。これは、観測→行動→実行→視覚結果という一方向の予測ではなく、行動と身体状態、さらに視覚遷移を相互に結びつける構造であり、人型ロボットに特有の「実行誤差」を学習ループに戻している点が重要だとみられる。 業界構造への含意としては、評価がLimX OLIの実機3課題で行われたことから、論点はシミュレーション上の一般性能ではなく、実機での行動実現に移っている。Candy Pickingで70.6%が43.3%を上回った事実は、同じ参照行動でも身体状態の予測を組み込む設計が実機成功率に影響しうることを示す。ただし、対象課題が3つのうち何であったか、他課題での個別成績、学習データ量、制御周期、推論遅延は本文からは読み取れない。次に確認すべきは、他課題での再現性、異なる人型機種への適用性、そしてこの3経路設計がどこまで制御系へ実装可能かである。
なぜ重要か
論文が示したのは、参照行動の生成だけではなく、実際に動いた後の身体状態を同時に扱う必要があるという点である。実機評価ではLimX OLIでCandy Pickingの成功率が70.6%となり、Fast-WAMの43.3%を上回ったため、実行誤差を含めた学習が成果に結びつく可能性がある。