日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
全身マニピュレーションarXiv:2609.19688

LYRIC: 言語駆動の物理ベース全身接触リッチ物体インタラクション制御

LYRIC: Language-Driven Physics-Based Character Control for Contact-Rich Whole-Body Object Interaction

シェア:XThreadsFacebookLINEはてブBluesky

自由形式の言語指示と目標物体位置から、物理シミュレーション上のキャラクタが全身で接触を伴う物体操作を行うフローマッチング制御器を提案。プランナと行動生成器に分解し、専門家軌道の追従と強化学習の微調整で高い成功率を達成した。

詳しい要約

1. どんなもの?

言語指示と疎な終端物体ゴールから、物理シミュレーション上のキャラクタが接触の多い全身物体操作を行うための生成フローマッチング制御器 LYRIC を提案する研究。 - 入力: free-form language instruction と sparse terminal object goal - 出力: 接触を伴う whole-body object interaction の動作 - 構成: task-level planner と action generator に分解 - 対象: シミュレーション上の humanoid と物体の相互作用

2. 先行研究と比べてどこがすごい?

先行研究と比べて、不完全な motion-capture 参照から信頼できる expert trajectory を得る点と、全身運動参照を規定せずに相互作用を進める点が特徴。 - 単一の tracking policy を geometry-conditioned interaction rewards と hand-object contact 付近の緩和された参照追従で学習 - 制御器を planner と action generator に分解し、閉ループで全身運動と接触を解決 - OMOMO 評価で tracker が 64.3% 成功、InterMimic 再実装の 53.2% を上回る - 統一 policy は OMOMO 全体で 76.5%、held-out split で 90.3% 成功、最強の matched kinematic-planner baseline の 74.2% を上回る - 再学習なしで test-time object-waypoint guidance に対応

3. 技術・手法の肝は?

技術の肝は、フローマッチングに基づく生成制御器を planner と action generator に分解し、接触リッチな全身操作を閉ループで実現する点。 - 不完全な motion-capture 参照から expert trajectory を得るため、geometry-conditioned interaction rewards と hand-object contact 近傍での緩和された参照追従を用いて単一 tracking policy を訓練 - task-level planner が短ホライズンの物体と humanoid-root の軌道を予測 - action generator が全身運動と接触を閉ループで解決 - behavior cloning 後に planner を凍結し、planner の予測を安定した supervision として action generator を on-policy で post-tune

4. どうやって有効だと検証した?

OMOMO データセットを用いた制御評価で有効性を検証。 - tracker は 64.3% 成功、InterMimic 再実装は 53.2% - 統一 policy は OMOMO 全体で 76.5% - held-out split で LYRIC は 90.3% 成功、最強の matched kinematic-planner baseline は 74.2% - 意味的整合性と motion quality も向上 - 再学習なしで test-time object-waypoint guidance をサポート - 定性的に robust で自然な接触リッチ相互作用と、新規物体形状への zero-shot transfer を実証

5. 議論はある?

議論として、全身運動参照を規定せずに相互作用を進める設計や、planner の予測を安定 supervision として使う post-tuning の有効性が示唆される。 - 不完全な motion-capture 参照への対処 - 接触リッチ操作における閉ループ制御 - 意味的整合性と motion quality の向上 - 新規物体形状への zero-shot transfer - ただし、要旨からは限界や失敗事例、計算コスト、実機転移の議論は不明

6. 次に読むべき論文は?

要旨で参照・比較されている研究として InterMimic と matched kinematic-planner baseline が挙げられる。 - InterMimic: 比較対象の再実装 - matched kinematic-planner baseline: 最強の比較手法 - 関連手法として、language-driven physics-based character control、flow-matching controller、whole-body object interaction、OMOMO データセットを用いた研究 - 同分野の定番として、physics-based character animation や human-object interaction の tracking policy に関する研究

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Zeyu Han, Zichong Meng, Julian Tanke, Minami Matsumoto, Sergey Bashkirov, Yingruo Fan, Selim Engin, Dongseok Shim, Takashi Shibuya, Yuki Mitsufuji, Huaizu Jiang

分類: cs.RO, cs.GR

原文アブストラクト

We present LYRIC, a generative flow-matching controller for language-driven physics-based contact-rich interaction control, that enables simulated characters to perform contact-rich whole-body object interactions from a free-form language instruction and a sparse terminal object goal. To obtain reliable expert trajectories from imperfect motion-capture references, a single tracking policy is trained using geometry-conditioned interaction rewards and relaxed reference tracking near hand-object contact. To guide interaction progress without prescribing a full-body kinematic reference, we factorize the controller into a task-level planner that predicts short-horizon object and humanoid-root trajectories, and an action generator that resolves whole-body motion and contacts in closed loop. After behavior cloning, we freeze the planner and post-tune the action generator on policy using the planner's predictions as stable supervision for intermediate task progression. In a controlled OMOMO evaluation, our tracker achieves 64.3% success compared with 53.2% for an InterMimic reimplementation, while a unified policy achieves 76.5% on the full OMOMO dataset. On the held-out split, LYRIC achieves 90.3% task success, compared with 74.2% for the strongest matched kinematic-planner baseline, with better semantic alignment and motion quality. Without retraining, the controller also supports test-time object-waypoint guidance. Qualitative results further demonstrate robust, natural contact-rich interactions and zero-shot transfer to novel object shapes. The webpage is available at https://neu-vi.github.io/LYRIC/

関連論文

PR本紙発行元 EmplifAI