日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
移動操作arXiv:2608.07746v1

LUCID: 想像上のダイナミクスによる潜在スキル統合制御による長期的ヒューマノイド移動操作

LUCID: Latent-Skill Unified Control via Imagined Dynamics for Long-Horizon Humanoid Loco-Manipulation

シェア:XThreadsFacebookLINEはてブBluesky

長期的なヒューマノイドの移動操作タスクを解決するため、学習したダイナミクスモデルを用いた想像上のロールアウトを通じて再利用可能なスキルを計画する階層的モデルベース強化学習フレームワークを提案した。

詳しい要約

1. どんなもの?

LUCIDは、長期的なヒューマノイドの移動操作(loco-manipulation)タスクのための階層的モデルベース強化学習フレームワークである。再利用可能なスキル(潜在変数で条件付けられた低レベルポリシー)を学習し、そのスキルを高レベルポリシーが想像上のロールアウト(imagined rollouts)を通じて計画する。具体的には、まず敵対的模倣学習(adversarial imitation)で構造化された潜在条件付き低レベルポリシーを訓練し、その後、高レベルポリシーとマクロダイナミクス世界モデル(macro-dynamics world model)を共同で学習する。世界モデルは潜在的な決定によって引き起こされる時間的に拡張された状態遷移を予測し、高レベルポリシーの最適化を可能にする。

2. 先行研究と比べてどこがすごい?

既存手法は、事前訓練されたスキルをスクリプト化されたプランナー、有限状態機械、またはタスク固有のモデルフリーポリシーと組み合わせることが多く、複雑なタスクシーケンスを扱う能力が制限されていた。LUCIDは、学習されたダイナミクスモデルの想像上のロールアウトを通じて再利用可能なスキルを計画する階層的モデルベース強化学習を提案することで、この制限に対処している。これにより、スクリプトやタスク固有の設計に依存せず、複雑なシーケンスを柔軟に扱える点が優れている。

3. 技術・手法の肝は?

手法の核心は、階層的モデルベース強化学習とマクロダイナミクス世界モデルの導入にある。まず、敵対的模倣学習を用いて潜在変数で条件付けられた低レベルポリシーを訓練し、多様な全身スキルを獲得する。その後、低レベルポリシーを凍結し、高レベルポリシーとマクロダイナミクス世界モデルを共同で学習する。世界モデルは潜在的な決定(スキルの選択)による時間的に拡張された状態遷移を予測し、高レベルポリシーはこのモデルを用いた想像上のロールアウトによって最適化される。これにより、長期的な計画が可能になる。

4. どうやって有効だと検証した?

シミュレーション環境における複数のマルチオブジェクト再配置シナリオ(multi-object rearrangement scenarios)で評価された。実験結果は、LUCIDが従来のベースライン手法と比較して、タスク全体の成功率(full-task success)と部分的な完了率(partial-completion rates)を向上させることを示した。

5. 議論はある?

要旨からは、LUCIDの有効性は示されているが、実世界での検証や、シミュレーションと実環境のギャップ(sim-to-real gap)については言及されていない。また、低レベルポリシーの敵対的模倣学習に必要な専門家データの取得方法や、世界モデルの学習に必要なデータ量などの詳細は不明である。さらに、提案手法の計算コストや、より複雑なタスクへのスケーラビリティについての議論も要旨には含まれていない。

6. 次に読むべき論文は?

要旨で参照されている先行研究は明示されていないが、関連する手法として、階層的強化学習(Hierarchical Reinforcement Learning)、モデルベース強化学習(Model-Based Reinforcement Learning)、敵対的模倣学習(Adversarial Imitation Learning)、およびヒューマノイドの移動操作(Humanoid Loco-Manipulation)に関する研究が挙げられる。具体的には、スキル事前訓練と計画を組み合わせた手法や、世界モデルを用いた強化学習(例:Dreamer)などが関連する。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Cheng Guo, Mingzhe Ni, Angelo Cangelosi, Arash Ajoudani

分類: cs.LG, cs.RO

原文アブストラクト

Long-horizon humanoid loco-manipulation requires composing versatile whole-body skills and reliable high-level decision making. Existing methods often coordinate pretrained skills with scripted planners, finite-state machines or task-specific model-free policies, restricting their ability to handle complex task sequences. To address this limitation, we propose \textbf{LUCID}, a hierarchical model-based reinforcement learning framework that plans over reusable skills through imagined rollouts of a learned dynamics model. LUCID first trains a structured latent-conditioned low-level policy via adversarial imitation and then freezes it while jointly learning a high-level policy and macro-dynamics world model. The world model predicts the temporally extended state transitions induced by latent decisions, enabling high-level policy optimization through imagined rollouts. We evaluate our framework across various simulated multi-object rearrangement scenarios. Experimental results show that LUCID improves the full-task success and partial-completion rates compared to prior baseline methods, demonstrating its effectiveness in complex sequential loco-manipulation tasks.