日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
身体化エージェント/記憶システムarXiv:2608.04933v1

Mimir: 対話環境における身体化エージェントのための動的グラウンディングを備えた神経記号記憶システム

Mimir: A Neuro-Symbolic Memory System with Dynamic Grounding for Embodied Agents in Interactive Environments

シェア:XThreadsFacebookLINEはてブBluesky

身体化エージェントの長期タスク遂行を改善するため、世界記憶とタスク記憶を分離し、行動前に動的にグラウンディングする神経記号記憶システムMimirを提案した。

詳しい要約

1. どんなもの?

Mimirは、長期的な身体性タスク(long-horizon embodied task)を遂行するエージェントのためのニューロシンボリックメモリシステムである。部分観測環境下で、シーン信念(scene belief)と実行進捗(execution progress)の両方を保持する。世界メモリ(world memory)とタスクメモリ(task memory)を分離し、各行動の前に動的グラウンディング(dynamic grounding)を行う。世界メモリは物体位置・状態・知覚的証拠を、タスクメモリは順序付き目標アジェンダ・進捗状態・手の状態・失敗・実行制約を管理する。グラウンディングモジュールがアクティブな目標を想起された世界候補に結び付け、欠落したソース位置を補完し、計画と実行の前に証拠を付与する。

2. 先行研究と比べてどこがすごい?

従来のフラットな履歴や暗黙的なポリシー状態は過去の観測を含むが、現在のアクティブな目標を支える世界の事実を明示的に選択するインターフェースを提供しない。Mimirは世界メモリとタスクメモリを分離し、動的グラウンディングにより目標と世界の関連を明示的に結びつける点が新しい。また、複数のバックボーンにわたり一貫した性能向上を示し、特にEB-Habitat Long-horizonサブセットで86.0%の成功率を達成し、クローズドソースモデルを大幅に上回る。

3. 技術・手法の肝は?

手法の核心は、世界メモリとタスクメモリの分離と、行動前の動的グラウンディングである。世界メモリは物体の位置・状態・知覚的証拠を保持し、タスクメモリは目標アジェンダ・進捗・手の状態・失敗・実行制約を管理する。グラウンディングモジュールは、アクティブな目標を想起された世界候補にバインドし、欠落したソース位置を埋め、計画と実行の前に証拠を付与する。これにより、エージェントは部分観測下でも現在の目標に関連する世界の事実を明示的に利用できる。

4. どうやって有効だと検証した?

EB-ALFREDとEB-Habitatのタスクで検証した。複数のバックボーンにわたりMimirを適用し、最大で42.5%の改善、平均で23.0%の改善を確認した。また、同じバックボーンで評価された先行エージェント・メモリシステムの最良結果と比較し、全体の平均成功率を8.5%向上させた。EB-Habitat Long-horizonサブセットでは86.0%の成功率を達成し、現在のクローズドソースモデルを大幅に上回った。

5. 議論はある?

要旨からは、Mimirの限界や潜在的な欠点についての議論は不明である。ただし、動的グラウンディングの計算コストや、世界メモリのスケーラビリティ、タスクメモリの表現力などが今後の課題となる可能性が考えられるが、要旨には明記されていない。また、クローズドソースモデルとの比較はあるが、オープンソースモデルとの詳細な比較は不明。

6. 次に読むべき論文は?

要旨で参照されている先行研究や関連手法は明示されていないが、EB-ALFREDとEB-HabitatはEmbodied Benchmarkの一種であり、これらのベンチマークを提案した論文が関連する。また、ニューロシンボリックメモリやグラウンディングに関する一般的な研究(例えば、Memory NetworksやSymbolic Grounding)が関連する。具体的には、EB-ALFREDの元となったALFREDベンチマークの論文や、Embodied AIにおけるメモリシステムの研究が次に読むべき候補である。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Haoming Xu, Zhenlin He, Hengyi Wang, Jiafeng Xu, Hao Dong

分類: cs.RO

原文アブストラクト

Long-horizon embodied task requires agents to act under partial observability while preserving both scene belief and execution progress. Flat histories or implicit policy states may contain past observations, but they do not provide an explicit interface for deciding which world facts support the currently active goal. We introduce Mimir, a neuro-symbolic memory that separates world memory from task memory and dynamically grounds them before each action. World memory maintains object locations, object states, and perceptual evidence, while task memory maintains an ordered goal agenda, progress state, hand state, failures, and execution constraints. A grounding module binds the active goal to recalled world candidates, fills missing source locations, and attaches evidence before planning and embodiment-specific execution. Across tested backbones, Mimir consistently improves on different EB-ALFRED and EB-Habitat tasks, with maximum gains of 42.5% and average gains of 23.0%, respectively. Compared with the best results among prior agent and memory systems evaluated under the same backbone, Mimir improves the overall average success rate by 8.5%. Finally, on the EB-Habitat Long-horizon subset, Mimir achieves 86.0% success rate, substantially outperforming current closed-source models. Our code will be released soon.