何が起きたか
arxiv.orgは2026-09-28、記憶拡張VLA向けの手法「Ledger」を公開した。単一のfine-tuned π0.5ポリシーに、フレームサンプリングによるポリシー内の短期記憶と、SAM3トラッカーとVLMキャプショナーで構成する外部の物体レジャーを組み合わせる方式である。RoboMMEでは、4つの評価項目の平均が64.3%となり、同一評価条件での既存最良手法45.9%を上回った。
詳細
Ledgerは、短期の知覚記憶はポリシー内部、長期の物体記憶は外部の読み取り可能な記録に置くべきだとする設計を採る。外部レジャーは、デモンストレーションをSAM3トラッカーとVLMキャプショナーで処理して作成し、LLMプランナーがステップ境界で参照する構成である。 論文は、RoboMMEにおいてobject referenceで60.7%(既存最良40.3%)、object permanenceで86.7%(同56.2%)を示したとしている。著者らは、指示と記録から実行時に記憶源を選ぶことで、タスクごとのルーターを不要にしたとしている。
Key Facts
| Ledgerは、記憶を短期の知覚記憶と長期の物体記憶に分けるVLA向け方式である。 | [1] |
| 単一のfine-tuned π0.5ポリシーに、SAM3トラッカーとVLMキャプショナーで作る外部の物体レジャーを組み合わせる。 | [1] |
| LLMプランナーがステップ境界でレジャーを参照し、実行時に記憶源を選ぶ。 | [1] |
| RoboMMEの4スイート平均は64.3%で、既存最良手法の45.9%を上回った。 | [1] |
| object referenceは60.7%対40.3%、object permanenceは86.7%対56.2%だった。 | [1] |
本紙の見方
Ledgerの新しさは、記憶を「モデル内部に持たせるか、外部に出すか」を一律に扱わず、短期の知覚記憶と長期の物体記憶で置き場を分けた点にある。VLAでは記憶を直接ポリシー内に埋め込む設計が一般的だが、この論文は、位置や保有状態、イベント履歴のような長期要素は外部の明示的レコードに置く方がよいと整理した。単なる性能比較ではなく、記憶の種類ごとにアーキテクチャの責務を分離した点が主軸である。 本紙の過去報道との接続はないが、論文内の構造だけ見ても、単一重みのπ0.5を共有しながら、フレームサンプリングの内部記憶とSAM3トラッカー+VLMキャプショナーの外部レジャーを併用している点が重要である。これは、ポリシーを巨大化して記憶を抱え込む路線より、観測の要約と履歴管理を別層に分ける路線に近い。LLMプランナーがステップ境界で参照するため、知覚、記録、意思決定の役割分担が明確になる。 業界構造への含意としては、長期の物体状態を扱うために、学習済みポリシーそのものだけでなく、トラッキング、キャプション、読み取り可能な記録、計画器をどう接続するかが競争点になる。とくにobject referenceとobject permanenceの改善幅が大きく、指示に対する短期応答より、見失った対象の継続把握や、どの物体をどこに置いたかの追跡で差が出やすい構成とみられる。一方で、RoboMME以外のタスクで同じ分解がどこまで再現するか、外部レジャーの更新コスト、SAM3とVLMキャプショナーの誤差が最終行動にどう波及するかは、本文だけでは確定しない。 未確定の論点は、Ledgerの計算負荷、外部レジャーの保存形式、実機での応答遅延、評価対象外のタスクでの汎化、そして記憶源選択を担うLLMプランナーの失敗条件である。論文は性能差を示したが、運用時にどの程度の追加処理が必要かまでは読めない。
なぜ重要か
論文が示した64.3%という平均値と、object reference・object permanenceでの差は、長期の物体状態を扱うロボットでは、ポリシー内部だけに記憶を閉じない設計が有効である可能性を示す。著者らの説明では、SAM3トラッカーとVLMキャプショナーで作った外部レジャーをLLMプランナーが読む構成が、単一ポリシーの弱点を補うとされる。