日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
言語指示ナビゲーション/シーン記憶arXiv:2609.08886

FRAME: 属性読み出しによる因子分解型検索を用いたオブジェクト中心シーン記憶

FRAME: Factored Retrieval via Attribute Readouts for Object-Centric Scene Memory

シェア:XThreadsFacebookLINEはてブBluesky

言語指示でロボットが物体を検索する際、複数の永続的属性(カテゴリ、材質、サイズなど)を組み合わせた検索を可能にするFRAMEを提案。属性ごとの証拠を学習し、軽量な行列計算で高精度なマルチ属性検索を実現した。

詳しい要約

1. どんなもの?

本論文は、言語指示に従うロボットが、時間経過とともに遭遇した物体を参照・再訪するための永続的なシーンメモリの検索問題を扱う。特に、カテゴリ、素材、サイズ、外観など複数の永続的属性で物体を指定する「attribute-compositional retrieval」を形式化し、そのための手法FRAMEを提案する。FRAMEは、自然言語クエリを属性重みに変換し、物体埋め込みから属性ごとの証拠を推定して、クエリに応じて統合することで物体をランク付けする。

2. 先行研究と比べてどこがすごい?

従来の言語誘導シーンメモリ検索は空間的・関係的参照に焦点を当てていたが、本研究は複数の永続的属性による物体指定に着目した点が新しい。また、検索を認識やアノテーションの曖昧さから分離する制御された評価プロトコルを導入し、属性合成検索の能力を直接評価できるようにした。

3. 技術・手法の肝は?

FRAMEの核心は、言語をクエリ関連の属性重みに変換し、学習されたreadoutを用いて物体埋め込みから属性ごとの証拠を推定し、クエリに従って証拠を統合して物体をランク付けする点にある。これにより、分解後の物体スコアリングを軽量な行列-ベクトル計算に削減できる。

4. どうやって有効だと検証した?

固定シーンメモリと属性定義ターゲットを用いた制御された評価プロトコルを導入し、未見のシーンと物体アセットに対して、代表的なシーンメモリ検索ベースラインと比較してFRAMEが優れた性能を示した。

5. 議論はある?

要旨からは、提案手法の限界や議論についての詳細は不明。ただし、属性合成検索が言語誘導ロボットの補完的なシーンメモリ能力として位置づけられ、永続的属性を合成可能な証拠として公開することで、正確かつ効率的なマルチ属性検索が可能になることが示唆されている。

6. 次に読むべき論文は?

要旨で参照されている代表的なシーンメモリ検索ベースラインの具体的な論文名は不明。関連分野の定番としては、言語誘導ナビゲーションやシーングラフを用いた物体検索に関する研究が挙げられる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Woosang Jeon, Sanghyeok Choi, Minwoo Kim, Taehyun Jung, Taehyeong Kim

分類: cs.CV, cs.RO

原文アブストラクト

Language-guided robots need persistent scene memories to follow instructions, revisit objects, and resolve references to objects encountered over time. While much of language-guided scene-memory retrieval has emphasized spatial or relational references, many everyday object references specify objects by multiple persistent attributes, such as category, material, size, or surface appearance. We formalize this problem as attribute-compositional retrieval, where a fixed object-centric scene memory is queried with natural language to retrieve the object satisfying the requested attributes. To investigate this capability directly, we introduce a controlled evaluation protocol with fixed scene memories and attribute-defined targets, separating retrieval from perception and annotation ambiguities. We then propose FRAME, which turns language into query-relevant attribute weights, uses learned readouts to estimate per-attribute evidence from object embeddings, and ranks objects by aggregating this evidence according to the query. Across held-out scenes and object assets, FRAME outperforms representative scene-memory retrieval baselines while reducing post-decomposition object scoring to lightweight matrix-vector computation. These results position attribute-compositional retrieval as a complementary scene-memory capability for language-guided robots, showing that persistent object attributes can be exposed as composable evidence for accurate and efficient multi-attribute retrieval.