日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
sim2realarXiv:2609.19600

WorldContact: 接触中心の世界モデルによるスケーラブルなロボット学習

WorldContact: A Contact-Centric World Model for Scalable Robot Learning

シェア:XThreadsFacebookLINEはてブBluesky

変形物体操作のための接触中心の世界モデルを提案し、限られた軌道データから効率的に追加学習データを生成して、実機ロボットのポリシー適応を成功させた。

詳しい要約

1. どんなもの?

- 変形物体操作のための contact-centric world model『WorldContact』を提案。 - 限られた高品質 trajectory から追加の学習データを効率的に生成する。 - 元の数値 simulator より大きな時間刻みで物体 dynamics を予測する。 - 16 種類の shopping-bag 操作タスクで評価。 - 生成データで vision-language-action policy を fine-tune し、実機に展開。

2. 先行研究と比べてどこがすごい?

- 従来の数値 simulator は急速な動きの解決と interpenetration 防止のため小さな積分刻みを要する。 - WorldContact はより大きな時間刻みで予測し、単一 H100 GPU で元 simulator 比 10 倍の高速化を実現。 - 限られた trajectory から効率的に追加データを生成できる点が特徴。 - 既存の vision-language-action policy の fine-tune に活用可能。

3. 技術・手法の肝は?

- contact-centric な world model を構築。 - 限られた高品質 trajectory を基に学習。 - 元の数値 simulator より大きな時間刻みで物体 dynamics を予測。 - 生成データを既存の vision-language-action policy の fine-tune に利用。 - 詳細なアーキテクチャや学習手法は要旨からは不明。

4. どうやって有効だと検証した?

- 16 種類の shopping-bag 操作タスクで評価。 - 単一 H100 GPU での state-rollout 計測で、rendering と disk I/O を除き元 simulator 比 10 倍の高速化を確認。 - 生成データで fine-tune した vision-language-action policy を実機に展開。 - bag lifting で、元 simulation データのみの fine-tune は単一試行成功率 65%、WorldContact で拡張したデータセットでは 95% を達成。

5. 議論はある?

- 結果は WorldContact による効率的なデータ生成と robot policy adaptation を支持。 - 限られた trajectory から追加データを生成する有効性を示す。 - 一方で、他のタスクや物体への汎化性、sim-to-real gap などは要旨からは不明。 - 計算コストやスケーラビリティに関する詳細な議論は要旨からは不明。

6. 次に読むべき論文は?

- 要旨で参照/比較されている研究は明示されていない。 - 関連手法として、vision-language-action policy、deformable-object manipulation、contact-centric world model、数値 simulator が挙げられる。 - 同分野の定番として、model-based reinforcement learning、sim-to-real transfer、world model を用いた robot learning の論文を読むと良い。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Caoliwen Wang, Mengdi Wang, Heng Zhang, Shixun Huang, Siyuan Chen, Chao Liu, Anpei Chen, Zhendong Wang, Peter Yichen Chen, Huamin Wang

分類: cs.RO

原文アブストラクト

Adapting robots to new objects and tasks requires interaction experience that can be costly to obtain. We present WorldContact, a contact-centric world model for deformable-object manipulation, constructed from a limited set of high-quality trajectories to generate additional training data efficiently. It predicts object dynamics using larger time steps than the source numerical simulator, which requires small integration steps to resolve rapid motion and prevent interpenetration. We evaluate WorldContact across 16 shopping-bag manipulation tasks. State-rollout measurements on a single H100 GPU show a $10\times$ speedup over the source simulator, excluding rendering and disk I/O. We use the generated data to fine-tune an existing vision-language-action policy and deploy it directly on a real robot. In bag lifting, the same policy achieves 65% single-attempt success when fine-tuned on source simulation data alone, compared with 95% when fine-tuned on the dataset expanded with WorldContact. These results support efficient data generation with WorldContact for robot policy adaptation.

関連論文

PR本紙発行元 EmplifAI