日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
マルチモーダル知覚arXiv:2610.06955

ROMA: 実世界の物体中心マルチセンサ能動知覚のためのLLMシステム

ROMA: LLM System for Real-World Object-Centric Multi-Sensory Active Perception

シェア:XThreadsFacebookLINEはてブBluesky

視覚・音・触覚・力覚を統合し、不足情報を能動的に獲得するLLMベースのロボット知覚システムROMAを提案。約2000物体のマルチセンサデータセットROMI-2Kと評価ベンチマークも構築した。

詳しい要約

1. どんなもの?

- 実世界の物体中心マルチセンサー能動知覚のためのLLMベースシステム「ROMA」を提案。 - 視覚・音声・触覚・力覚を統合し、推論-相互作用-フィードバックループを実現。 - 不足する証拠を特定し、対象物体・相互作用・モダリティを決定。 - 物理インタフェースが選択された相互作用を実行し、マルチセンサーフィードバックを収集。 - 大規模実世界データセット「ROMI-2K」を構築(約2,000物体、6つの原子相互作用、同期センサーフィードバック)。 - 2段階訓練フレームワークで感覚モダリティを整合し、LLMに証拠十分性評価・情報量の多い相互作用選択・マルチセンサー推論を学習。 - 能動知覚を「perception chains」として特徴づけ、獲得証拠が後続の相互作用と推論を導く。 - 評価ベンチマーク「ROMA Bench」を確立(単一属性、長距離マルチ属性、意図駆動型能動知覚)。

2. 先行研究と比べてどこがすごい?

- 既存のマルチセンサーロボットシステムは感覚入力を統合するだけで、相互作用を通じて不足証拠を能動的に獲得しない。 - ROMAは能動的に不足証拠を獲得し、複雑で長連鎖のマルチセンサー知覚タスクを解決できる。 - 既存手法が苦手とするタスクを処理可能。 - 能動的マルチセンサー身体性エージェントのための強力な知覚基盤を提供。

3. 技術・手法の肝は?

- LLMをベースに、視覚・音声・触覚・力覚を統合した推論-相互作用-フィードバックループを構築。 - モデルが不足証拠を特定し、対象物体・相互作用・モダリティを決定。 - 物理インタフェースが選択された相互作用を実行し、マルチセンサーフィードバックを収集。 - 2段階訓練フレームワーク:感覚モダリティの整合と、LLMへの証拠十分性評価・情報量の多い相互作用選択・マルチセンサー推論の学習。 - 能動知覚をperception chainsとして特徴づけ、獲得証拠が後続の相互作用と推論を導く。

4. どうやって有効だと検証した?

- 大規模実世界データセットROMI-2K(約2,000物体、6原子相互作用、同期センサーフィードバック)を構築。 - 評価ベンチマークROMA Benchを確立し、単一属性・長距離マルチ属性・意図駆動型能動知覚を評価。 - 実験により、ROMAが能動的に不足証拠を獲得し、既存手法が苦手とする複雑で長連鎖のマルチセンサー知覚タスクを解決できることを示した。

5. 議論はある?

- 要旨からは不明。

6. 次に読むべき論文は?

- 要旨で参照/比較されている研究は明示されていない。 - 同分野の関連手法として、マルチセンサーロボットシステム、能動知覚、LLMベースのロボティクス、身体性AIの研究が挙げられる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Ruoxuan Feng, Yutong Chen, Ruihua Song, Huan Yang, Zhongyuan Wang, Guocai Yao, Di Hu

分類: cs.RO, cs.CV

原文アブストラクト

Humans inherently understand the physical world through an active process. When sensory evidence is insufficient to infer physical properties, we naturally interact with the environment by deciding what information is missing, how to acquire it, and when sufficient evidence has been obtained. In stark contrast, existing multi-sensory robot systems mainly integrate sensory inputs rather than actively acquiring missing evidence through interactions. In this work, we introduce ROMA, an LLM-based system for Real-World Object-Centric Multi-Sensory Active Perception. ROMA integrates vision, audio, tactile, and force sensing into a reasoning-interaction-feedback loop. The model identifies missing evidence and determines the target objects, interactions, and modalities, while a physical interface executes the selected interactions and collects the multi-sensory feedback. To support this capability, we construct ROMI-2K, a large-scale real-world multi-sensory object interaction dataset covering nearly 2,000 objects and 6 atomic interactions with synchronized sensory feedback. Building on these data, we develop a two-stage training framework that aligns sensory modalities and equips the LLM to assess evidence sufficiency, select informative interactions, and reason over the multi-sensory feedback. We further characterize active perception as perception chains, where acquired evidence guides subsequent interactions and reasoning, and establish ROMA Bench to evaluate single-attribute, long-horizon multi-attribute, and intent-driven active perception. Experiments show that ROMA can actively acquire missing evidence and solve complex, long-chain multi-sensory perception tasks that existing methods struggle to handle, laying a strong perceptual foundation for active multi-sensory embodied agents.

関連論文

PR本紙発行元 EmplifAI