日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
タスク計画arXiv:2608.25641v1

物体間アフォーダンスを活用した接触リッチタスクにおける効率的な計画

Leveraging Inter-object Affordances for Efficient Planning in Contact-rich Tasks

シェア:XThreadsFacebookLINEはてブBluesky

物体間の物理的相互作用を抽象化するアフォーダンスをVLMで生成し、TAMPの計画領域を拡張することで、接触を伴う複雑なタスクの計画成功率を向上させる手法を提案した。

詳しい要約

1. どんなもの?

本論文は、接触を伴うタスク(contact-rich tasks)におけるロボットの計画効率を向上させるため、物体間アフォーダンス(inter-object affordances)を活用した新しいTAMP(Task-and-Motion Planning)手法を提案している。提案手法はUnified TAMP (U-TAMP)と呼ばれ、物体中心の抽象化(object-centric abstractions)を用いて実行制約を定義する。Vision-Language Model (VLM)を用いて、把持や支持などの物理的相互作用制約を表す物体間アフォーダンスの抽象化を生成し、これをU-TAMPの計画ドメインに組み込むことで、異なる形状・サイズ・材質の物体を扱う。シミュレーション環境でのキッチンテーブル整理タスクにおいて、従来のU-TAMPやVLMベースのプランナーと比較し、計画成功率の大幅な向上と計画時間の1〜2桁の短縮を実証している。

2. 先行研究と比べてどこがすごい?

従来のTAMPアプローチは、単純化された物体モデルを仮定し、接触を伴うタスクに重要な物理的特性(摩擦、変形など)を無視することが多い。また、動作計画中にサブシンボリック推論を用いるため、計画時間が増大し成功率が低下する。本手法は、VLMを用いて物体間アフォーダンスの抽象化を自動生成し、これをシンボリックな計画ドメインに組み込むことで、物理的特性の異なる物体を扱いつつ、サブシンボリック推論を回避し、計画効率を大幅に改善している点が優れている。

3. 技術・手法の肝は?

手法の核は、U-TAMPフレームワークにVLMを統合し、物体間アフォーダンスの抽象化を生成することである。具体的には、VLMを用いて、接触を伴うタスクにおける物体間の物理的相互作用制約(例:把持、支持)を特徴付けるアフォーダンスを抽出する。これらの抽象化は、U-TAMPの計画ドメインを拡張するために使用され、物体の可変な物理的特性を扱えるようにする。これにより、シンボリックな計画とモーション計画の分離が可能となり、計画時間を短縮する。

4. どうやって有効だと検証した?

シミュレーション環境でのキッチンテーブル整理タスクを用いて実験を行った。比較対象は、元のU-TAMPと、物体のアフォーダンスに関する常識知識を利用する最先端のVLMベースのプランナーである。その結果、提案手法は計画成功率を大幅に向上させ、計画時間を他の手法と比較して1〜2桁改善した。

5. 議論はある?

要旨からは、提案手法の限界や議論についての詳細は不明である。ただし、VLMの生成するアフォーダンス抽象化の正確性や、実世界の複雑な物理現象への適用可能性などが議論の対象となる可能性がある。また、シミュレーションのみでの検証であり、実ロボットでの検証が今後の課題と考えられる。

6. 次に読むべき論文は?

要旨で参照されている関連研究として、元のU-TAMP(Unified TAMP)と、VLMベースのプランナー(物体のアフォーダンスの常識知識を利用するもの)が挙げられる。次に読むべき論文としては、これらの元論文や、TAMPにおけるアフォーダンス活用の関連研究が考えられる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Pouya P. Niaz, Justus Piater, Alejandro Agostini

分類: cs.RO, cs.AI

原文アブストラクト

Traditional task-and-motion planning (TAMP) approaches primarily focus on defining sequences of actions along with the necessary geometric and kinematic constraints to execute long-horizon tasks. However, their applicability in real-world settings is limited, as they typically assume simplified object models that overlook key physical properties critical for the successful execution of contact-rich tasks. Moreover, they often use sub-symbolic reasoning during motion planning, which drastically increases planning time and decreases overall success rates. We propose a method that leverages a TAMP approach, defining object-centric abstractions of execution constraints, called Unified TAMP (U-TAMP), to execute robotic tasks involving interactions among objects with heterogeneous shapes, sizes, and materials. Using a Vision-Language Model (VLM), we generate abstractions of inter-object affordances for characterizing physical interaction constraints between objects in contact-rich tasks, such as grasp and support constraints. These constraints are used to enrich the U-TAMP planning domain to deal with objects with variable physical properties. We perform experiments in simulated kitchen table organization scenarios and compare our results with those of the original U-TAMP, as well as a state-of-the-art VLM-based planner that leverages common sense knowledge of objects' affordances for plan generation. Our approach achieves significantly higher planning success rates and improves planning times by one to two orders of magnitude compared to other methods.

関連論文