日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
マニピュレーションarXiv:2609.28184

VLMは記述できるが計測できない:ロボットマニピュレーションのための物体中心シーン理解

VLMs Can Describe, But Not Measure: Object-Centric Scene Understanding for Robotic Manipulation

シェア:XThreadsFacebookLINEはてブBluesky

RGB-D画像から物体領域をセグメント化しVLMで注釈付けと深度情報を統合することで、VLM単体より位置・深度推定精度を高める物体中心表現を構築し、タスク計画と連携させた。

詳しい要約

1. どんなもの?

- 未知環境でのロボット操作には意味理解と信頼できる計量情報が必要。 - VLMは意味理解に強いが幾何推定は信頼性が低い。 - 本論文はVLM駆動のモジュール型知覚フレームワークを提案。 - 単一RGB-D観測から物体レベル領域に分割し、VLMで注釈、深度で接地。 - タスク非依存の物体中心表現を構築。 - 151の卓上シーンで実験。 - 直接VLM推論より定位と深度推定を改善。 - タスク計画フレームワークと統合しロボット実行。

2. 先行研究と比べてどこがすごい?

- 従来のVLM直接推論は意味性能は高いが幾何推定が不正確。 - 提案手法はモジュール型分解により意味性能を維持しつつ定位と深度推定を大幅改善。 - 既製手法を組み合わせ、タスク非依存の物体中心表現を構築する点が新しい。 - 151シーンでの実験で直接VLM推論に対する優位性を実証。

3. 技術・手法の肝は?

- 単一RGB-D観測を入力。 - 物体レベル領域にセグメント化。 - VLMによる注釈付け。 - 深度情報で接地。 - タスク非依存の物体中心表現を構築。 - 既製(off-the-shelf)アプローチを利用したモジュール型パイプライン。 - タスク計画フレームワークと統合。

4. どうやって有効だと検証した?

- 151の卓上シーンで実験。 - 提案分解が意味性能を維持しつつ、定位と深度推定を直接VLM推論より大幅改善することを示した。 - 構築した表現をタスク計画フレームワークと統合し、ロボット実行に適用。

5. 議論はある?

- 要旨からは不明。

6. 次に読むべき論文は?

- 要旨で参照/比較されている研究は明示されていない。 - 関連手法としてVLM(Vision-Language Model)、RGB-D、物体中心表現、タスク計画が挙げられる。 - 同分野の定番としてCLIP、GPT-4V、RT-1、SayCanなどが考えられるが、要旨に記載なし。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Enrico Saccon, Tommaso Faraci, Iñigo De La Ossa Zarzuelo, Luigi Palopoli, Marco Roveri, Matteo Saveriano

分類: cs.RO, cs.CV

原文アブストラクト

Robotic operation in previously unseen environments requires both semantic understanding and reliable metric information. While vision--language models (VLMs) provide strong semantic capabilities, their geometric estimates remain less reliable. In this paper, we propose a VLM-driven, modular perception framework for scene understanding using off-the-shelf approaches. Starting from a single RGB-D observation, the scene is segmented into object-level regions, annotated by a VLM, and grounded with depth information to construct a task-independent object-centric representation. Experiments on 151 tabletop scenes show that the proposed decomposition preserves strong semantic performance while substantially improving localization and depth estimation over direct VLM inference. The resulting representation is also integrated with a task-planning framework for robotic execution.

関連論文

PR本紙発行元 EmplifAI