日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
マニピュレーションarXiv:2609.21621

細粒度物体操作に向けて:SAM3誘導視覚運動ポリシーと持続的メモリ学習および集中視覚条件付け

Towards Fine-Grained Object Manipulation: SAM3-Guided Visuomotor Policy with Persistent Memory Learning and Focused Visual Conditioning

シェア:XThreadsFacebookLINEはてブBluesky

SAM3を凍結したまま少数の多視点画像から対象物体のメモリトークンを学習し、バウンディングボックス座標と外観特徴を組み合わせて拡散ポリシーやACTを条件付けすることで、類似物体や妨害物がある実環境での細粒度物体操作を実現した。

詳しい要約

1. どんなもの?

- 微細物体(FO)操作のためのSAM3誘導視覚運動フレームワーク - 永続的物体メモリと焦点視覚条件付けを導入 - FOM-SAM3とFSAEの2要素から構成 - 実ロボット3タスクで検証

2. 先行研究と比べてどこがすごい?

- シーン全体の視覚条件付けは明示的物体選択が欠如 - カテゴリレベル誘導は同カテゴリ内FO識別が困難 - 提案手法は限られた多視点画像から再利用可能なメモリトークンを学習 - 類似物体の拒否とターゲット定位を実現

3. 技術・手法の肝は?

- FOM-SAM3: SAM3を凍結し、one-vs-rest学習でFOメモリトークンを獲得 - メモリバンクに保存し永続的メモリを実現 - FSAE: FO内局所外観特徴と明示的バウンディングボックス座標を組み合わせ - DPやACTなどの行動ポリシーを条件付け

4. どうやって有効だと検証した?

- FO-30データセット(4粗カテゴリ、30物理物体)でFOM-SAM3を検証 - 実ロボット3つのFO操作タスクで評価 - 妨害物体への頑健性、類似FO識別能、新規FOへの拡張性を確認

5. 議論はある?

- 要旨からは不明

6. 次に読むべき論文は?

- SAM3 - Diffusion Policy (DP) - Action Chunking with Transformers (ACT) - FO-30データセット

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Haolong Meng, Fangbo Qin, Mengchen Bai, Houwu Wang, Cirong Liu, Shan Yu

分類: cs.RO

原文アブストラクト

Fine-grained object (FO) manipulation requires robots to distinguish a specified FO from visually similar objects and execute actions reliably despite scene distractors. However, scene-level visual conditioning lacks explicit object selection, while category-level guidance cannot reliably distinguish FOs within the same category. We present a SAM3-guided visuomotor framework that addresses these challenges through persistent object memory and focused visual conditioning. First, we introduce FO Memory-driven SAM3 (FOM-SAM3), which learns reusable FO memory tokens from limited multi-view registration images while keeping SAM3 fully frozen. Through one-vs-rest learning, these tokens encode persistent memories for localizing target FOs and rejecting similar alternatives, which can be stored in a memory bank. Second, we propose Focused Spatial-Appearance Encoding (FSAE), which combines in-FO local appearance features with explicit bounding-box coordinates to condition action policies including Diffusion Policy (DP) and Action Chunking with Transformers (ACT). The effectiveness of the proposed FOM-SAM3 was validated on the FO-30 dataset comprising 30 physical objects across four coarse categories. Across three real-robot FO manipulation tasks, our FOM-SAM3-guided policies demonstrated robustness against distractors, discrimination ability among similar FOs, and extendibility to new FOs.

関連論文

PR本紙発行元 EmplifAI