何が起きたか
arxiv.orgは2026-09-23、OCC4M(Occam)と呼ぶオブジェクト中心の4D記憶を公開した。長期のマニピュレーションで問題になる、現在視界にない物体の位置、時間的同一性、並べ替えられた容器の中身を扱うための仕組みである。シミュレーション7条件・350エピソードでは、記憶成功率96.6%、エンドツーエンド成功率88.9%を示した。
詳細
OCC4Mは、共有された世界座標系の中で持続的なトラックを維持し、時間関係・運動関係・包含関係を明示的に表現する設計である。VLMがこの構造化記憶を参照し、履歴をそのまま低レベル制御に渡さず、実行可能な対象を選ぶ構成になっている。 比較対象のFrameSampは、Gemini 3.7 Flashを使い、完全な観測履歴を与えるraw-history VLMベースラインとされる。視点移行の制御実験では、OCC4Mは記憶成功率100%、エンドツーエンド成功率98%を維持した一方、FrameSampはほぼゼロまで低下した。固定カメラのFranka実験20エピソードでは、OCC4Mは関節レベルの記憶正解率85%を達成し、K=16から完全履歴までの各条件でFrameSampの最大30%を上回り、全2段階タスクの45%を完了した。
Key Facts
| OCC4M(Occam)は、長期のマニピュレーション向けにオブジェクト中心の4D記憶を提案した。 | [1] |
| 共有世界座標系で持続的トラックを維持し、時間・運動・包含関係を明示的に表現する。 | [1] |
| シミュレーション7条件・350エピソードで、記憶成功率96.6%、エンドツーエンド成功率88.9%を達成した。 | [1] |
| 視点移行実験で、OCC4Mは記憶成功率100%、エンドツーエンド成功率98%を維持した。 | [1] |
| 固定カメラのFranka 20エピソードで、関節レベル記憶正解率85%、全2段階タスク完了率45%を示した。 | [1] |
本紙の見方
OCC4Mの新しさは、長期タスクで失われやすい物体状態を、単なる過去映像の蓄積ではなく、共有世界座標系に固定したオブジェクト中心の4D記憶として扱う点にある。これは、視界外に出た物体や容器内の内容を追うという課題に対して、履歴を全部見せればよいという発想から一段進んだ設計である。他方で、VLMが構造化記憶を参照して低レベル実行対象を選ぶという枠組み自体は、視覚と言語を組み合わせた既定路線の延長にも位置づく。 本紙の関連記事はないため、過去報道との連続性は置かない。今回の結果で重要なのは、視点が変わった条件でもOCC4Mが記憶成功率100%、エンドツーエンド成功率98%を保ち、FrameSampがほぼゼロまで落ちた点である。ここからは、長期マニピュレーションの失敗要因が「情報量不足」だけでなく、世界座標に紐づかない履歴の扱い方にある可能性が読み取れる。つまり、単純な履歴長の拡大より、物体単位での状態保持と関係表現の有無が性能差を分けたとみられる。 業界構造への含意としては、ロボットの実世界導入で必要になるのが、画像認識単体ではなく、状態・位置・時間・包含を結び付けた記憶層だという点が明確になった。特に、容器の中身や見失った物体を扱う工程では、認識モデル、メモリ表現、実行器の役割分担が重要になる。今後確認すべき論点は、シミュレーション中心の結果が実機でどこまで再現されるか、関節レベル記憶の評価がどのタスクに一般化するか、そしてVLM側がどの程度の失敗を記憶層で補えるかである。
なぜ重要か
OCC4Mは、長期操作で必要な「見えていない物体の状態」を、過去映像の羅列ではなく構造化記憶として扱うため、ロボットが視点変化や遮蔽に弱いという課題に直接関係する。発表者は、シミュレーション7条件・350エピソードと固定カメラのFranka実験で、既存のraw-history VLMより高い成功率を示したとしている。
日本への影響
日本でロボットの実運用を考える場合も、把持や仕分けの前段で「何がどこにあり、何が容器内に残っているか」を追跡できる記憶層の有無が論点になり得る。とくに、視点が変わる作業環境や、同一対象を繰り返し扱う工程では、単発認識よりも物体中心の状態管理が重要になるとみられる。