日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
両腕操作arXiv:2609.08339

RoboCousin: 堅牢な両腕ロボット操作のための自作シミュレーションプレイグラウンド

RoboCousin: Build Your Own Simulation Playground for Robust Bimanual Robotic Manipulation

シェア:XThreadsFacebookLINEはてブBluesky

ユーザーが提供した観測データを再利用可能なアセットやシーン、専門家の軌道に変換する、拡張可能なシミュレーションベースのデータ生成プラットフォームを提案し、両腕操作ポリシーの訓練データを大規模に生成する。

詳しい要約

1. どんなもの?

RoboCousinは、ユーザーが提供した観測データ(物体画像など)を、シミュレーションで再利用可能なアセット、シーン、およびバイマニュアル操作のエキスパート軌道に変換する、拡張可能なシミュレーションベースのデータ生成プラットフォームです。RoboTwin 2.0上に構築され、物体画像から視覚・衝突ジオメトリ、意味・物理メタデータ、自動生成された把持接触候補を持つシミュレーション用アセットを生成します。また、タスク関連のアフォーダンスと空間関係を維持しながら、互換性のある物体、背景、レイアウト、言語指示を変化させる「デジタルいとこ」を構築します。テーブルトップおよび部屋レベルのシーン構築をサポートし、固定ワークスペースを超えたインタラクションのための衝突認識ベース制御を備えています。

2. 先行研究と比べてどこがすごい?

既存のシミュレーションパイプラインは、閉じたアセットライブラリと事前定義されたシーン内で動作し、新しい物体や環境を追加するには、ジオメトリの再構築、物理的・意味的特性の指定、インタラクションの注釈付け、実行可能なタスクへの統合に多大な労力が必要でした。RoboCousinは、ユーザー提供の観測を直接シミュレーション用アセットとシーンに変換することでこのプロセスを自動化し、手動注釈なしで拡張可能なデータ生成を実現します。さらに、生成されたアセットがシミュレーションから実機への転移に有効であることを示し、単一の再構築シーンでのトレーニングを超えた転移改善を実証しています。

3. 技術・手法の肝は?

RoboCousinは、物体画像をシミュレーション用アセットに変換するために、視覚ジオメトリと衝突ジオメトリを生成し、意味的・物理的メタデータを付与し、把持接触候補を自動生成します。また、互換性のある物体、背景、レイアウト、言語指示を変化させながらタスク関連のアフォーダンスと空間関係を維持する「デジタルいとこ」を構築します。テーブルトップおよび部屋レベルのシーン構築をサポートし、衝突認識ベース制御により固定ワークスペースを超えたインタラクションを可能にします。

4. どうやって有効だと検証した?

RoboCousin-OBDデータセット(3,000以上の注釈付き物体インスタンスと50の背景環境)をリリースし、50タスクにわたって100万以上のエキスパート軌道を生成しました。シミュレーションと実機実験により、自動生成されたインタラクション注釈が手動注釈と同等であること、生成されたアセットがシミュレーションから実機への転移に有効であること、テーブルトップのいとこが単一の再構築シーンでのトレーニングを超えた転移を改善することを検証しました。

5. 議論はある?

要旨からは、RoboCousinの限界や潜在的な問題についての議論は不明です。ただし、生成されたアセットの品質や、多様なタスクへの一般化、実機での性能などに関する詳細な分析は要旨に含まれていないため、今後の研究で検討される可能性があります。

6. 次に読むべき論文は?

要旨で参照されているRoboTwin 2.0が関連研究として挙げられます。また、バイマニュアル操作のシミュレーションデータ生成に関する他の研究や、sim-to-real転移の手法も関連します。具体的な論文名は要旨にないため、同分野の定番として、シミュレーション環境(例:Isaac Gym, MuJoCo)やデータ生成手法(例:Domain Randomization)に関する論文が考えられます。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Jingxuan Zhu, Jingyi Li, LiangLiang Chen, Zhiyuan Jing, Jidong Zhang, Hongming Li

分類: cs.RO, cs.AI

原文アブストラクト

Bimanual manipulation policies require large and diverse training datasets, yet collecting demonstrations on physical robots is expensive and difficult to scale. Simulation can generate data efficiently, but existing pipelines typically operate within closed asset libraries and predefined scenes: adding a newly observed object or environment still requires substantial effort to reconstruct geometry, specify physical and semantic properties, annotate interactions, and integrate the result into executable tasks. We present RoboCousin, an extensible simulation-based data-generation platform that turns user-provided observations into reusable assets, scenes, and expert trajectories for bimanual manipulation. Built on RoboTwin~2.0, RoboCousin converts object images into simulation-ready assets with visual and collision geometry, semantic and physical metadata, and automatically generated grasp-contact candidates. It further constructs digital cousins that vary compatible objects, backgrounds, layouts, and language instructions while preserving task-relevant affordances and spatial relations. The same asset system supports tabletop and room-level scene construction, with collision-aware base control for interaction beyond a fixed workspace. We release RoboCousin-OBD, containing more than 3,000 annotated object instances and 50 background environments, and use RoboCousin to generate over one million expert trajectories across 50 tasks. Simulation and real-robot experiments show that the automatically generated interaction annotations are comparable to curated annotations, generated assets provide effective sim-to-real supervision, and tabletop cousins can improve transfer beyond training on a single reconstructed scene. RoboCousin therefore provides a practical path for expanding both the scale and coverage of synthetic bimanual manipulation data.

関連論文