日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
両手操作/把持arXiv:2608.10383v1

単一視点観測による大型物体の実世界協調両手巧緻把持

Real-World Cooperative Bimanual Dexterous Grasp of Large Objects from Single-View Observations

シェア:XThreadsFacebookLINEはてブBluesky

大型物体の両手による協調把持を実世界で実現するため、多モーダルデータセットと拡散モデルを用いた把持生成、および動作計画とオンライン補正を統合したフレームワークを提案した。

詳しい要約

1. どんなもの?

本論文は、単一視点の観測から大型物体を協調的に把持する実世界向けバイマニュアル・デクスタラス把持フレームワークを提案する。関節角度・視覚観測・力信号を含むマルチモーダルデータセット、セグメント化された点群から関節レベルの把持配置を生成するDenoising Diffusion Probabilistic Model (DDPM)ベースのモジュール、運動計画とオンライン把持修正を統合した実行戦略から構成される。完全な3D物体モデルに依存せず、単一視点入力から実行可能なバイマニュアル把持を合成し、実世界での安定性を確保する。

2. 先行研究と比べてどこがすごい?

既存研究の多くは逐次操作に焦点を当て、協調把持を扱う手法はシミュレーションに限定されていた。その理由は、完全な3D物体モデルの取得困難性と物理的に妥当な把持動作の生成困難性にある。本手法は、実世界で動作するバイマニュアル把持フレームワークを提案し、完全な3Dモデルへの依存を減らし、単一視点入力から実行可能な把持を合成する点で先行研究より優れている。

3. 技術・手法の肝は?

手法の核は、(1)関節角度・視覚観測・力信号を含むマルチモーダルデータセットの構築、(2)セグメント化された点群から関節レベルの把持配置を生成するDDPMベースのモジュール、(3)運動計画とオンライン把持修正を統合した実行戦略である。これにより、完全な3D物体モデルを必要とせず、単一視点の観測から物理的に安定で実行可能なバイマニュアル把持を生成する。

4. どうやって有効だと検証した?

デュアルアームロボットを用いた実験で、様々な形状・姿勢の未知物体に対して高い成功率を達成した。また、アブレーション研究により、システムの主要コンポーネントの貢献を確認した。

5. 議論はある?

要旨からは、提案手法の限界や他の手法との比較に関する議論は不明である。ただし、実世界での性能向上に焦点を当てており、シミュレーションとのギャップを埋めることが重要であると示唆される。

6. 次に読むべき論文は?

要旨で参照されている関連研究として、バイマニュアル操作やデクスタラス把持に関する既存研究が挙げられる。具体的には、シミュレーションでのバイマニュアル把持手法や、DDPMを用いた把持生成手法などが関連する。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Ziming Li, Mingxuan Wu, Jiaqi Zhang, Hongfei Li, Yan Gan, Deqiang Ouyang, Ning Wang

分類: cs.RO

原文アブストラクト

Bimanual dexterous grasping of large objects is a critical challenge in robotic manipulation. However, most existing studies focus on sequential manipulation rather than cooperative grasping, and methods addressing such bimanual tasks have largely been limited to simulation. These limitations stem from the difficulty of acquiring full 3D object models and generating physically plausible grasping actions. To fill this gap, we propose a real-world bimanual grasping framework that includes: a multimodal dataset capturing joint angles, visual observations and force signals; a Denoising Diffusion Probabilistic Model (DDPM)-based module that generates joint-level grasp configurations from segmented point clouds; and an execution strategy that integrates motion planning with online grasp refinement to ensure physical stability and feasibility. Our approach enables the synthesis of executable bimanual grasps from single-view inputs, reducing dependence on complete 3D object models and ensuring stable real-world performance. Experiments on a dual-arm robot demonstrate high success rates across unseen objects with varying geometries and poses, and ablation studies confirm the contributions of key components of our system.