何が起きたか

arXivに2026-09-16付で掲載された論文は、部分観測された3D空間で言語が指す物体を見つけるための「Finder」を発表した。Finderは、クエリに応じた計画、限定した証拠収集、候補検証、accept/continue/abort制御を一つの閉ループとして扱う物体探索プリミティブである。Habitat/HM3D上のopen-vocabulary embodied Object Retrievalと実世界RGB-Dシーンで、強いベースラインに対して平均1m成功率を15.75ポイント改善したとしている。

詳細

論文は、従来手法を「オンライン探索と結びついた物体検索」か「静的な一回限りのシーン表現への問い合わせ」に大別し、その中間にある処理としてFinderを置いている。Finderのtyped loop stateは、query-conditioned planning、scoped evidence gathering、candidate verification、accept/continue/abort controlを接続し、証拠が不完全または曖昧な場合に次の知覚や比較の向け先を変えられる設計だとしている。 性能面では、open-vocabulary embodied Object Retrievalの評価先としてHabitat/HM3Dと実世界RGB-D scenesを用い、平均1m success rateで15.75 pointsの改善を示したとしている。同じ原理は sequential object grounding と embodied object-centric question answering にも移植でき、内部の grounding protocolを変えずに空間的・時間的な位置特定を改善したとしている。

Key Facts

論文名は「Finder: Agentic Closed-Loop Object Finding for Embodied Grounding」である。[1]
掲載日は2026-09-16である。[1]
Finderは、query-conditioned planning、scoped evidence gathering、candidate verification、accept/continue/abort controlを含む閉ループの物体探索プリミティブである。[1]
評価先はHabitat/HM3Dと実世界RGB-D scenesである。[1]
open-vocabulary embodied Object Retrievalで、平均1m success rateを15.75 points改善したとしている。[1]

本紙の見方

Finderの新しさは、物体を「見つける」処理を単発の検索ではなく、証拠が足りなければ再観測に戻る閉ループとして実装した点にある。一方で、対象はあくまで部分観測3D空間における言語参照の解決であり、ロボット全体の行動計画そのものを置き換える話ではない。つまり、検索の入口を賢くしたというより、根拠が曖昧なときに止める・続ける・やり直す判断を組み込んだ点が核である。 本紙の過去報道はないため、ここでは前後関係よりも構造を読む必要がある。Finderは「クエリに応じた計画→限定証拠の収集→候補検証→accept/continue/abort」という順で、探索と検証を同一のループに束ねている。従来の open-vocabulary 系では、埋め込み空間やシーン表現への照合が先に立ち、曖昧さが残る場合でも上位候補を返して終わる設計が多かったが、Finderはその終端条件を変えている。ここが、単なる精度改善と違い、エージェントの振る舞いを変える部分だとみられる。 業界構造への含意としては、影響先はロボット本体よりも、3Dシーン理解、視覚言語モデル、探索の制御層にある。Habitat/HM3Dのようなシミュレーション環境で有効でも、実世界RGB-Dでも同じ原理が通る点は、学習済み表現の精度だけでなく、実運用時の再観測ロジックが競争力になることを示す。特に sequential object grounding や object-centric question answering にも転用可能としているため、1回の照合で終えるQA系より、連続観測を伴う実体環境での推論に使い道が広い。一方で、今後確認すべきなのは、どの程度の探索回数で改善が頭打ちになるか、候補検証の計算負荷、曖昧な場合の abort 判断が実環境でどう働くか、そしてベースライン差15.75ポイントがどの条件で維持されるかである。

なぜ重要か

Finderは、言語で指定された物体を一度で当てるのではなく、追加観測を挟んで確かめる設計であるため、誤検出や曖昧な候補をそのまま返す場合に比べ、実世界RGB-Dのような不完全観測環境での使い方が変わる可能性がある。論文はHabitat/HM3Dと実世界RGB-D scenesで平均1m success rateが15.75 points改善したとしており、評価環境がシミュレーションと実環境の双方にまたがる点がこの手法の適用条件を示している。