何が起きたか
arxiv.orgで2026-09-24に公開された論文は、ヒューマノイド向けの全身移動・操作タスクを対象に、LLMが実行可能な高位ポリシーコードを生成するHuGoを提案した。低位の全身ポリシーは固定し、タスク記述、観測、命令仕様に基づいてLLMがタスクロジックをコード化する。論文はさらに、ロールアウトから数値軌道と選択した動画フレームを使ってフィードバックを与え、コードを部分更新する反復ループも示している。
詳細
HuGoは「Humanoid policy code Generation」を意味し、階層型のアプローチとして設計されている。論文によると、LLMは高位の制御方針をコードとして生成し、下位の全身ポリシーは凍結したまま用いる。生成後は、ロールアウトの数値軌道と選択された動画フレームを手掛かりに、コード更新を行う。 評価では、5つのシミュレーション課題と2種類の低位ポリシーで検証し、高位の強化学習ベースラインを大きく上回ったとしている。また、デモンストレーションベースラインに近い性能に達し、シミュレーションで生成したポリシーを実機へゼロショット移行できたとしている。実機ロールアウトに同じ反復改善ループを適用すると、専門家デモなしでも転移性能がさらに改善したとしている。
Key Facts
| HuGoは、LLMを用いてヒューマノイドの全身移動・操作タスク向けの実行可能な高位ポリシーコードを生成する手法である。 | [1] |
| 低位の全身ポリシーは固定し、タスク記述、観測、命令仕様からタスクロジックをコード化する。 | [1] |
| ロールアウト後は、数値軌道と選択した動画フレームを使ってフィードバックを与え、ターゲットを絞ったコード更新を行う。 | [1] |
| 論文は5つのシミュレーション課題と2種類の低位ポリシーで評価した。 | [1] |
| HuGoは高位の強化学習ベースラインを上回り、デモンストレーションベースラインに近い性能を示したとしている。 | [1] |
本紙の見方
HuGoの新しさは、ヒューマノイドの全身移動・操作を「学習済み低位ポリシー+LLMが書く高位コード」に分離した点にある。従来は報酬設計やタスクごとのデモ収集が必要だったのに対し、この手法はタスク記述を入力にして制御ロジックを生成し、さらにロールアウトから得た数値軌道と動画フレームでコードを絞り込む構成を取る。つまり、行動の生成だけでなく、実行後の修正までコード生成の対象にしている点が主眼である。 本紙の見方では、これは単なる「LLMをロボットに使う」話ではなく、全身制御の上位層をソフトウェア的に差し替える試みだといえる。下位の全身ポリシーを凍結したまま使うため、改善の焦点はモーター制御や姿勢制御そのものより、タスク分解、条件分岐、観測の読み取り、再試行の記述に置かれる。ここで本紙が注目するのは、コード更新の材料として数値軌道と動画フレームを併用している点で、実世界の挙動を再び言語モデルの修正入力に戻す循環があることだ。これは、単発の推論で終わる生成ではなく、実行ログを次の制御記述に接続する設計である。 5つの課題で強化学習ベースラインを上回り、デモンストレーションベースラインに近づいたとしても、まだ評価範囲は限定的である。今後確認すべきは、課題の種類、実機での成功率、どの程度の一般化が可能か、そしてコード更新が安全制約や失敗時の復帰行動をどう扱うかである。
なぜ重要か
HuGoは、ヒューマノイドの移動と操作をまとめて扱う上位ロジックをLLMで生成し、実行結果を使って更新するため、タスク追加のたびに報酬設計やデモ収集を積み増す負担を減らせる可能性がある。論文が示したゼロショットの実機移行と、実機ロールアウトを使った追加改善は、研究段階でも「シミュレーションで作って終わり」にしない設計として意味がある。
日本への影響
日本のヒューマノイド研究や実機検証では、全身制御ポリシーそのものに加えて、タスク記述から高位コードを生成し、実機ログで更新する流れをどう組み込むかが論点になる可能性がある。特に、シミュレーションから実機へのゼロショット移行を前提にするなら、評価環境、ログ整備、失敗時の安全確認を含む実験基盤の整え方が重要になる。