日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
能動的知覚/アフォーダンス接地arXiv:2608.12683v1

FUSE: 適応的意味・幾何学的証拠獲得による能動的機能的アフォーダンス接地

FUSE: Active Functional Affordance Grounding through Adaptive Semantic-Geometric Evidence Acquisition

シェア:XThreadsFacebookLINEはてブBluesky

エージェントが機能に基づいて物体を識別・接地するため、不確実性駆動の探索と学習型プランナーを組み合わせて視点を選択する能動的機能的アフォーダンス接地フレームワークFUSEを提案し、Habitatベースのベンチマークで評価した。

詳しい要約

1. どんなもの?

本論文は、Embodied Agentが物体の同一性ではなく機能に基づいて物体を特定・操作する問題に取り組む。特に、機能的手がかりが遮蔽されたり不完全な場合に、エージェントが能動的に観測を取得して機能的手がかりを明らかにする「Active Functional Affordance Grounding」という新しいタスクを提案する。提案手法FUSEは、不確実性駆動の明示的探索と学習されたamortized plannerを組み合わせ、情報量の高い視点を効率的に選択する適応的意味・幾何学的証拠獲得フレームワークである。また、Habitatベースのベンチマークを導入し、能動的機能接地の評価を可能にする。

2. 先行研究と比べてどこがすごい?

既存のaffordance grounding手法は固定視点から観測し、機能的手がかりが遮蔽された場合にどこを見るべきかを決定するメカニズムが欠如している。本研究は、能動的探索を導入し、不確実性駆動の明示的探索と学習されたプランナーを組み合わせることで、効率的な視点選択を実現する点が新しい。また、機能接地のための能動的探索を評価するベンチマークを新たに提供する点も貢献である。

3. 技術・手法の肝は?

FUSEは、明示的な不確実性駆動探索と学習されたamortized plannerを組み合わせる。具体的には、現在の観測から物体の機能的手がかりの不確実性を推定し、不確実性の高い領域を重点的に探索する。同時に、学習されたプランナーが過去の経験から効率的な視点選択を提案し、両者を適応的に統合することで、計算コストを抑えつつ高い接地精度を達成する。

4. どうやって有効だと検証した?

Habitatベースのベンチマークを構築し、FUSEの性能を評価した。実験では、非オラクル接地性能において最高の精度を達成し、完全に明示的な探索と比較して計算量を1.33倍削減した。また、複数のaffordance知識ソースに対して有効であることを示した。

5. 議論はある?

要旨からは、FUSEの性能が知識ソースに依存する可能性や、実環境での適用に関する議論は不明である。また、オラクル性能との差や、探索戦略の一般性についての詳細な議論は要旨に含まれていない。

6. 次に読むべき論文は?

要旨で参照されている関連研究として、既存のaffordance grounding手法や、能動的視点選択に関する研究が挙げられる。具体的には、固定視点でのaffordance grounding手法や、不確実性駆動の探索手法、学習ベースのプランニング手法などが関連する。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Zhou Chen, Sathyanarayanan N. Aakur

分類: cs.RO, cs.CV

原文アブストラクト

Embodied agents must often identify and interact with objects based on their function rather than their identity, requiring them to actively acquire observations that reveal discriminative functional evidence. Existing affordance grounding methods operate from fixed viewpoints and lack mechanisms for deciding where to look when functional cues are occluded or incomplete. We introduce Active Functional Affordance Grounding, a new task in which an agent sequentially explores a scene to identify and spatially ground an object satisfying a functional query. To address this problem, we propose FUSE, an adaptive semantic-geometric evidence acquisition framework that combines explicit uncertainty-driven exploration with a learned amortized planner to efficiently select informative viewpoints. We further introduce a Habitat-based benchmark for evaluating active functional grounding. Experiments show that FUSE achieves the highest observed non-oracle grounding performance while reducing computation by 1.33x relative to fully explicit exploration, and remains effective across multiple affordance knowledge sources.