日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
メモリ/エージェントarXiv:2608.21755

ECHO: 認知に着想を得た監査可能なメモリプレーンによる長期的エージェント

ECHO: A Cognitively Inspired, Auditable Memory Plane for Long-Horizon Agents

シェア:XThreadsFacebookLINEはてブBluesky

長期的なタスクを扱うエージェント向けに、エピソード記憶や再固定化などの認知機能に着想を得た監査可能なメモリアーキテクチャ「ECHO」を提案し、検索性能を評価した。

詳しい要約

1. どんなもの?

ECHO (Embodied Context and History Orchestration) は、長期ホライズンエージェント向けの監査可能なメモリアーキテクチャおよびサービスプロトタイプである。エピソード符号化、統合、文脈的再活性化、再統合、実行制御といった認知機能に触発された設計であり、神経的等価性ではなく機能的な着想に基づく。検索と文脈構築に焦点を当てた実証分析が行われている。

2. 先行研究と比べてどこがすごい?

先行研究と比較して、ECHOはメモリの関連経験の特定、リビジョンの解決、検証可能な来歴の公開を統合的に扱う点で優れている。特に、認知科学の原理を応用した監査可能なメモリプレーンを提案し、単なる検索精度だけでなく、プロvenance(来歴)の追跡を可能にしている。また、既存のMem0 OSSと比較して、特定のQAサンプルでは精度が低いものの、検索拡張による開発測定値としての位置づけを明確にしている。

3. 技術・手法の肝は?

手法の核は、エピソード符号化、統合、文脈的再活性化、再統合、実行制御という認知プロセスを模倣したメモリ管理である。具体的には、履歴をエピソードとして符号化し、統合プロセスを経て、クエリに応じて文脈を再活性化する。さらに、再統合によってリビジョンを解決し、実行制御によって検索と文脈構築を調整する。監査可能性を確保するため、クエリ拡張ルールにソース固有のフレーズを組み込むが、これは開発測定値としての性質を持つ。

4. どうやって有効だと検証した?

有効性の検証は、LoCoMoデータセットのカテゴリ1〜4の1,536質問でHit@10が96.29%、turn Recall@5が73.64%、LongMemEval-Sの全500質問でHit@10が97.60%、turn Recall@5が88.84%、session Recall@5が88.71%という結果に基づく。また、5履歴のBEAMゲートは失敗し、91質問のマッチングQAサンプルではMem0 OSSが64.84%、ECHOが41.76%で、正確なMcNemar検定でp=0.00107と有意差があった。ただし、履歴クラスターの区間はゼロをまたいでおり、事後監査でクエリ拡張ルールにソース固有のフレーズが見つかったため、これらのスコアは独立した確認ではなく記述的な開発測定値とされる。

5. 議論はある?

議論としては、ECHOの検索拡張が有効である一方で、Mem0 OSSとの比較で精度が低い点が挙げられる。また、履歴クラスターの区間がゼロをまたぐことから、統計的有意性に疑問が残る。さらに、事後監査でクエリ拡張ルールにソース固有のフレーズが含まれていたため、開発測定値が独立した確認ではないという限界がある。要旨からは、これらの結果が実環境での性能を保証するものではないという議論が示唆される。

6. 次に読むべき論文は?

次に読むべき論文は、要旨で参照されているLoCoMoデータセットとLongMemEval-Sデータセットに関する論文、および比較対象であるMem0 OSSの論文が挙げられる。また、関連する認知アーキテクチャやメモリモデルに関する研究も有用である。具体的なタイトルは要旨からは不明だが、これらのデータセットや手法の詳細を扱った論文を参照することが推奨される。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Yu Qian, Hong Miao, Boyang Guo, Tingyi Jiang, Shan Zhao, Tianxing Le, Lintian Li, Meng Liu

分類: cs.AI

原文アブストラクト

Long-horizon agents need memory that identifies relevant experience, resolves revisions, and exposes checkable provenance. We present ECHO (Embodied Context and History Orchestration), an auditable memory architecture and service prototype inspired by episodic encoding, consolidation, contextual reinstatement, reconsolidation, and executive control. This is functional inspiration, not neural equivalence; the empirical analysis focuses on retrieval and context construction. Development runs reach 96.29% Hit@10 and 73.64% turn Recall@5 on 1,536 LoCoMo category 1-4 questions, and 97.60% Hit@10, 88.84% turn Recall@5, and 88.71% session Recall@5 on all 500 LongMemEval-S questions. A five-history BEAM gate fails, and in a separate matched 91-question QA sample Mem0 OSS scores 64.84% versus ECHO's 41.76% (exact McNemar p = 0.00107), with a history-cluster interval crossing zero. A post-hoc audit found source-specific phrases in the query-expansion rules. Although no gold answer field entered the runtime, expansion-enabled retrieval scores are therefore descriptive development measurements, not independent confirmation.