何が起きたか

研究者らは、対話型環境における身体性エージェント向けの神経記号メモリシステム「Mimir」を提案した。Mimirは世界記憶(物体の位置・状態・知覚的証拠)とタスク記憶(目標の順序付きアジェンダ、進捗状態、手の状態、失敗、実行制約)を分離し、各行動の前に動的グラウンディングを行う。グラウンディングモジュールは、アクティブな目標を想起された世界候補に結び付け、欠落したソース位置を補完し、計画と実行の前に証拠を付与する。実験では、複数のバックボーンにわたりEB-ALFREDおよびEB-Habitatタスクで一貫した改善が見られ、最大42.5%、平均23.0%の向上を達成。同一バックボーンで評価された従来のエージェント・メモリシステムの最良結果と比較して、全体の平均成功率を8.5%向上させた。さらに、EB-Habitat Long-horizonサブセットでは86.0%の成功率を達成し、現在のクローズドソースモデルを大幅に上回った。コードは近日公開予定。

Key Facts

Mimirは世界記憶とタスク記憶を分離し、各行動前に動的グラウンディングを行う神経記号メモリシステムである。[0]
MimirはEB-ALFREDおよびEB-Habitatタスクで最大42.5%、平均23.0%の成功率向上を達成した。[0]
同一バックボーンで評価された従来システムの最良結果と比較して、Mimirは全体の平均成功率を8.5%向上させた。[0]
EB-Habitat Long-horizonサブセットでMimirは86.0%の成功率を達成し、現在のクローズドソースモデルを大幅に上回った。[0]
Mimirのコードは近日公開予定である。[0]

なぜ重要か

長期的な身体性タスクでは、部分観測下でのシーン信念と実行進捗の保持が課題となる。Mimirは世界記憶とタスク記憶を分離し、動的グラウンディングによって目標に関連する世界の事実を明示的に結び付けることで、成功率を大幅に向上させた。これは、ロボットや対話型エージェントの実用的な性能向上に寄与する可能性があり、特にクローズドソースモデルを凌駕する結果は、オープンな神経記号手法の有効性を示している。