日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
ヒューマノイド制御arXiv:2609.25754

PLAT: 特権潜在遷移学習によるヒューマノイド制御のためのスパース時間指定キーフレーム動作追従

PLAT: Sparse Timed Keyframe Motion Tracking for Humanoid Control via Privileged Latent Transition Learning

シェア:XThreadsFacebookLINEはてブBluesky

スパースなキーフレームと到達時刻のみから全身動作を生成するヒューマノイド制御フレームワークPLATを提案し、シミュレーションとUnitree G1実機で有効性を示した。

詳しい要約

1. どんなもの?

- ヒューマノイドの運動追跡ポリシーは密なフレームごとの参照に依存し、高レベル運動制御器としての利用が制限されている。 - 本研究では「Sparse Timed Keyframe Motion Tracking」を扱う。これは、ポリシーが疎な将来のキーフレームとその到着時刻のみを受け取り、連続する目標に到達する安定した全身運動を実行する必要がある。 - 提案手法PLATは、Privileged Latent Transition学習を用いた3段階の疎な時間指定キーフレーム運動追跡ポリシー学習フレームワークである。 - 訓練時には密な目標系列を特権的監督として活用し、展開時には疎な時間指定キーフレームコマンドのみを必要とする。

2. 先行研究と比べてどこがすごい?

- 従来の密なフレームごとの運動追跡は、計画やインタラクティブな運動生成のための高レベル運動制御器としての利用が制限されていた。 - PLATは、密な運動追跡と疎な目標条件付き制御の橋渡しをし、訓練時のみ密な目標系列を特権的監督として利用する。 - これにより、展開時には疎な時間指定キーフレームコマンドのみで、安定した全身運動を実現できる。 - 特に長い計画ホライズンのコマンド下で強い性能を発揮する点が、先行研究と比べて優れている。

3. 技術・手法の肝は?

- 3段階の学習フレームワークを採用。 - 第1段階:事前学習済みの密な追跡エキスパートが堅牢な運動事前分布を提供する。 - 第2段階:DAggerスタイルの模倣を通じて特権的潜在事前分布を学習する。 - 第3段階:潜在残差強化学習により、直接行動を最適化するのではなく潜在遷移を洗練する。 - これにより、疎な時間指定キーフレームコマンドへの適応を実現する。

4. どうやって有効だと検証した?

- 広範なシミュレーション実験を実施し、PLATが様々な計画ホライズンにわたって正確かつ安定した疎な時間指定キーフレーム追跡を維持することを示した。 - 特に長い計画ホライズンのコマンド下で強い性能を発揮する。 - Unitree G1ヒューマノイドロボットへの展開に成功し、疎なヒューマノイド運動制御に対するPLATの有効性と実用性を実証した。

5. 議論はある?

- 要旨からは、議論や限界についての明示的な記述は不明。 - ただし、シミュレーションと実機展開の成功が報告されており、有効性と実用性が示唆されている。

6. 次に読むべき論文は?

- 要旨で参照/比較されている研究は明示されていない。 - 関連手法として、密な運動追跡、DAgger、強化学習、潜在変数モデル、ヒューマノイド制御などが挙げられる。 - 同分野の定番として、Humanoid Motion Tracking、Goal-Conditioned Control、Reinforcement Learning for Humanoid Locomotionなどが考えられる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Zepeng Wang, Jiangxing Wang, Chao Ma, Xiaochuan Shi, Zongqing Lu

分類: cs.RO

原文アブストラクト

Humanoid motion tracking policies rely on dense frame-by-frame references, limiting their use as high-level motion controllers for planning and interactive motion generation. We study \emph{Sparse Timed Keyframe Motion Tracking}, where a policy receives only sparse future keyframes and their desired arrival times, and must execute stable whole-body motions that reach successive goals. We propose \textbf{PLAT}, a three-stage sparse timed keyframe motion tracking policy learning framework with \textbf{P}rivileged \textbf{LA}tent \textbf{T}ransition learning. PLAT bridges dense motion tracking and sparse goal-conditioned control by exploiting dense goal sequences as privileged supervision during training while requiring only sparse timed keyframe commands at deployment. A pretrained dense tracking expert first provides robust motion priors. A privileged latent prior is then learned through DAgger-style imitation, followed by latent residual reinforcement learning that refines latent transitions instead of directly optimizing actions. Extensive simulation experiments demonstrate that PLAT maintains accurate and stable sparse timed keyframe tracking across varying planning horizons, with particularly strong performance under long-horizon commands. Successful deployment on a Unitree G1 humanoid robot further demonstrates the effectiveness and practicality of PLAT for sparse humanoid motion control.

関連論文

PR本紙発行元 EmplifAI