日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
マニピュレーションarXiv:2608.19776v1

CoToGrasp: 接触トポロジー条件付き器用な把持合成のための正準ワークスペース学習

CoToGrasp: Contact-Topology-Conditioned Dexterous Grasp Synthesis via Canonical Workspace Learning

シェア:XThreadsFacebookLINEはてブBluesky

物体の形状に依存せず、指定された接触トポロジーに厳密に従う多様で安定した把持を生成する新しいフレームワークを提案。物体非依存の学習により、未見物体へのゼロショット一般化を実現し、物理ロボットでの実証も行った。

詳しい要約

1. どんなもの?

CoToGraspは、特定の接触トポロジー(contact topology)に厳密に条件付けられた多様で安定した器用な把持(dexterous grasp)を合成する生成フレームワークである。従来の把持プランナーが物理的安定性のみを最適化するのに対し、CoToGraspは「どのように把持するか」という機能的意図を接触トポロジーとして明示的に条件付けする。データ収集のボトルネックを回避するため、オブジェクト非依存(object-agnostic)な方法で完全に訓練される。特徴ベースの正準作業空間(canonical workspace)を導入し、局所的なオブジェクト特徴をグリッパー中心の領域に投影することで、意味的機能意図と任意のオブジェクト形状を分離する。この作業空間内でグリッパーの内在的接触多様体を学習することで、推論時に未見オブジェクトへのゼロショット一般化を達成する。

2. 先行研究と比べてどこがすごい?

先行研究の把持プランナーは主に物理的安定性を最適化し、下流の機能タスクを支える「どのように把持すべきか」を考慮していなかった。一方、人間の把持分類学(taxonomy)に基づく条件付けは、オブジェクトごとの注釈付きデータセットを必要とし、コストが prohibitive であった。CoToGraspは、接触トポロジーを条件として生成する点で新規であり、かつオブジェクト非依存の訓練によりデータ収集のボトルネックを回避する。さらに、特徴ベースの正準作業空間を導入することで、オブジェクト形状から機能的意図を分離し、未見オブジェクトへのゼロショット一般化を可能にした点が優れている。

3. 技術・手法の肝は?

手法の核は、特徴ベースの正準作業空間(canonical workspace)の導入である。これは、局所的なオブジェクト特徴をグリッパー中心の統一領域に投影し、意味的機能意図と任意のオブジェクト形状を分離する。この作業空間内で、グリッパーの内在的接触多様体(intrinsic contact manifold)を学習する生成モデルを訓練する。訓練はオブジェクト非依存(object-agnostic)で行われ、特定のオブジェクトに依存しない。推論時には、未見オブジェクトの局所特徴を正準作業空間に投影し、学習した接触多様体から接触トポロジーを生成する。これにより、ゼロショット一般化を実現する。

4. どうやって有効だと検証した?

大規模なDexGraspNetデータセットを用いた広範な評価を実施し、既存のtaxonomy-guidedプランナーと比較して、state-of-the-artの性能を達成したことを示した。さらに、物理ロボットプラットフォーム上で合成された接触トポロジーの物理的実現可能性と運動学的実現可能性を実証した。

5. 議論はある?

要旨からは、議論の詳細は不明である。ただし、オブジェクト非依存の訓練とゼロショット一般化のトレードオフや、接触トポロジーの定義の粒度、実ロボットでの性能とシミュレーションとのギャップなどが考えられるが、要旨には明記されていない。

6. 次に読むべき論文は?

要旨で参照されているDexGraspNetデータセットに関する論文や、既存のtaxonomy-guidedプランナーに関する研究が挙げられる。また、接触トポロジーや把持分類学に関する基礎的な研究(例えば、Cutkoskyの把持分類学)も関連する。具体的な論文名は要旨からは不明である。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Julien Merand, Boris Meden, Liming Chen, Mathieu Grossard

分類: cs.RO, cs.AI

原文アブストラクト

Current dexterous grasp planners primarily optimize for physical stability, focusing on whether an object can be grasped rather than how it should be grasped to support downstream functional tasks. However, conditioning grasp synthesis on specific human grasp taxonomies typically requires prohibitively expensive, object-annotated datasets. To address these limitations, we propose CoToGrasp, a novel generative framework that synthesizes diverse, stable grasps strictly conditioned on specific contact topologies. To bypass the data collection bottleneck, CoToGrasp is trained entirely in an object-agnostic manner. We introduce a feature-based canonical workspace that projects local object features into a unified gripper-centric domain, effectively decoupling the semantic functional intent from the arbitrary object geometry. By learning the intrinsic contact manifold of the gripper within this workspace, our model achieves zero-shot generalization to unseen objects at inference. Extensive evaluations on the large-scale DexGraspNet dataset demonstrate that CoToGrasp achieves state-of-the-art performance, outperforming existing taxonomy-guided planners. Finally, we demonstrate the physical viability and kinematic feasibility of our synthesized contact topologies on a physical robot platform. Code is available on our project website https://cea-list.github.io/cotograspweb/ .

関連論文