日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
マニピュレーションarXiv:2609.10050

生成動画プランをシミュレーションで接地し多様な器用操作コントローラを実現

Grounding Generated Video Plans in Simulation Towards Versatile Dexterous Controllers

シェア:XThreadsFacebookLINEはてブBluesky

生成された手と物体のインタラクション動画をシミュレーションで接地し、多様な把持や操作を実行できる器用なロボットハンドコントローラを学習する手法を提案。

詳しい要約

1. どんなもの?

- 生成されたhand-object interaction (HOI) ビデオをシミュレーションでgroundingし、多様な器用なコントローラを学習する手法を提案。 - 訓練時には生成ビデオが多様な運動参照を提供し、多物体・多軌道のHOIトラッカーを学習。 - 展開時にはビデオモデルが運動計画を生成し、学習済みトラッカーが実行。 - 1,500以上の生成ビデオをシミュレーションでgroundingすることに成功。

2. 先行研究と比べてどこがすごい?

- 従来のシミュレーションベースHOIトラッキングは信頼できる参照運動の不足によりスケーラビリティが制限されていた。 - 生成ビデオとシミュレーションベースHOI groundingを組み合わせることで、参照運動のスケーラブルな生成を実現。 - シミュレーションベース訓練において、ベースラインよりも25パーセントポイント以上高い成功率を達成。

3. 技術・手法の肝は?

- 生成ビデオをHOI再構成によりシミュレーションでgroundingする手法を提案。 - 最小限の手動介入でスケーラブルな参照生成を可能にする。 - 訓練時:生成ビデオから多様な運動参照を取得し、多物体・多軌道HOIトラッカーを学習。 - 展開時:ビデオモデルが運動計画を生成し、学習済みトラッカーが実行する閉ループシステム。

4. どうやって有効だと検証した?

- 1,500以上の生成ビデオをシミュレーションでgroundingすることに成功。 - シミュレーションベース訓練において、ベースラインよりも25パーセントポイント以上高い成功率を達成。 - 実世界の閉ループ実験で、多様な把持(機能的把持、非把持操作、把持後の物体姿勢追跡)を実現。

5. 議論はある?

- 要旨からは不明。

6. 次に読むべき論文は?

- 要旨で参照/比較されている研究は明示されていない。 - 関連手法として、hand-object interaction (HOI) tracking、simulation-based HOI grounding、video generation for manipulation planning などが挙げられる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Tianyue Wu, Boyuan An, Shuqi Zhao, Heyu Guo, Wanli Xing, Yi Ma, Kaifeng Zhang, Ruihai Wu, Masayoshi Tomizuka

分類: cs.RO

原文アブストラクト

Generated hand-object interaction (HOI) videos provide a controllable way to propose manipulation motions. Simulation-based HOI tracking can translate such kinematic references into feasible low-level control, but its scalability is limited by the lack of reliable reference motions. We therefore combine generated videos with simulation-based HOI grounding: during training, generated videos provide diverse motion references for learning a multi-object, multi-trajectory HOI tracker, and at deployment, the video model produces motion plans that are executed by the learned tracker. In particular, we propose a method that enables scalable reference generation by HOI reconstruction with minimal manual intervention and successfully grounds more than 1,500 generated videos in simulation, achieving success rates over 25 percentage points higher than those of baselines during simulation-based training. In real-world closed-loop experiments, it achieves diverse grasps, including functional grasps, non-prehensile manipulation, and post-grasp object-pose tracking. Videos and code are available at https://boyuan-an.github.io/GALATEA/.

関連論文