何が起きたか
arxiv.orgは2026年9月17日、論文「LYRIC: Language-Driven Physics-Based Character Control for Contact-Rich Whole-Body Object Interaction」を掲載した。論文は、自由形式の言語指示と疎な最終物体ゴールから、接触を伴う全身の物体操作をシミュレーション上で実行する生成的フローマッチング制御器LYRICを提案している。評価では、制御されたOMOMO評価でトラッカーが64.3%の成功率、統合ポリシーがOMOMO全体で76.5%を示した。
詳細
LYRICは、完全な全身キネマティック参照を与えずに進捗を導くため、制御器を2段に分けている。1つはタスクレベルのプランナーで、短い先読み範囲の物体軌道とヒューマノイド根元軌道を予測する。もう1つはアクション生成器で、閉ループで全身運動と接触を解決する。 学習面では、まず行動模倣を行い、その後プランナーを固定して、プランナーの予測を中間タスク進行の安定した教師としてアクション生成器をポリシー上で追加調整する。論文はまた、テスト時の物体ウェイポイント誘導を再学習なしで扱えるとしており、定性的結果として自然な接触を伴う相互作用と、未知の物体形状へのゼロショット移行を示したとしている。
Key Facts
| 論文名は「LYRIC: Language-Driven Physics-Based Character Control for Contact-Rich Whole-Body Object Interaction」である。 | [1] |
| 掲載日は2026-09-17で、媒体はarxiv.orgである。 | [1] |
| LYRICは、自由形式の言語指示と疎な最終物体ゴールから接触を伴う全身の物体操作を行う生成的フローマッチング制御器である。 | [1] |
| 制御器は、短期の物体・ヒューマノイド根元軌道を予測するタスクレベルのプランナーと、全身運動と接触を解くアクション生成器に分割されている。 | [1] |
| 制御されたOMOMO評価ではトラッカーが64.3%の成功率、統合ポリシーはOMOMO全体で76.5%を示した。 | [1] |
本紙の見方
この論文の新しさは、言語から全身の接触動作までを一気通貫で生成する点にある。ただし中身を分解すると、完全な end-to-end の一枚岩ではなく、短期の物体・根元軌道を出すプランナーと、実際の接触と姿勢を解くアクション生成器に分ける構成である。ここには、言語理解よりも、接触を含む物理制御を安定化させるために中間表現を置くという設計判断が見える。 評価結果も、この構造の意味を裏づける。OMOMOでは、トラッカー64.3%がInterMimic再実装の53.2%を上回り、統合ポリシーは76.5%を記録した。さらにホールドアウト分割では90.3%のタスク成功率で、最強の整合するキネマティック・プランナー基準の74.2%を上回ったとしている。つまり焦点は単なる成功率の改善ではなく、セマンティック整合性とモーション品質を保ちながら、接触の多い操作を成立させる点にあるとみられる。 本紙の過去報道との接続はないが、論文の構成からは、今後の争点がはっきりする。第一に、OMOMO以外の環境で同じ分解構造が維持できるかである。第二に、ゼロショットで新しい物体形状に移った際に、成功率と自然さがどこまで保たれるかである。第三に、テスト時の物体ウェイポイント誘導が、どの程度広いタスク集合で通用するかである。現時点では、再学習なしで扱える条件や失敗例の範囲は論文要旨からは限定的で、実ロボットやより複雑な接触条件への一般化はまだ確認が必要だとみられる。
なぜ重要か
論文が示したのは、言語指示だけでなく接触を伴う物理的制約を含む操作を、プランニング層と実行層に分けて扱う設計である。これは、単純な動作生成ではなく、物体軌道・身体根元軌道・全身接触の整合を取る必要がある課題に関係する。