日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
マニピュレーションarXiv:2609.20820

ワークスペースモデル:顕著性駆動型監督による軽量ロボットメモリ

Workspace Models: Lightweight Robotic Memory via Saliency-Driven Supervision

シェア:XThreadsFacebookLINEはてブBluesky

訓練時にVLMでタスクに必要な情報を抽出し、軽量な潜在メモリ「ワークスペーストークン」に蒸留することで、展開時にVLM推論なしで記憶を要する操作タスクを解けるようにした。

詳しい要約

1. どんなもの?

- ロボットの複雑な操作タスクにおける長期記憶を軽量に実現する手法。 - 過去のイベントや行動の履歴を圧縮し、タスクに必要な情報のみを保持する「workspace token」を提案。 - 訓練時にVLMクエリを実行し、展開時には軽量な潜在記憶として利用可能。

2. 先行研究と比べてどこがすごい?

- 従来は展開時にVLMクエリをループ内で実行し、履歴を圧縮する手法が主流だった。 - 提案手法は訓練時のみVLMクエリを行い、展開時にはVLM推論不要で軽量。 - さらに、workspace tokenは従来の観測の代替として機能し、ポリシー性能も向上することを発見。

3. 技術・手法の肝は?

- VLMを用いてタスク完了に必要な現在および過去の情報を特定。 - set-reconstruction decoder lossにより、それらの情報をworkspace tokenに蒸留。 - 訓練時にVLMクエリを実行し、展開時には軽量な潜在記憶としてクエリ可能。

4. どうやって有効だと検証した?

- シミュレーションとハードウェアの両方で検証。 - workspace tokenを観測のドロップイン代替として使用し、記憶集約型タスクをVLM推論なしで解決できることを示した。 - 性能が向上することも確認。

5. 議論はある?

- workspace tokenがより軽量であるだけでなく、ポリシー性能も向上するという興味深い発見。 - 具体的な議論や限界については要旨からは不明。

6. 次に読むべき論文は?

- 要旨で参照/比較されている研究は明示されていない。 - 関連手法として、VLMをループ内で用いるポリシーメモリ手法や、set-reconstruction decoder lossを用いた蒸留手法が挙げられる。 - 同分野の定番として、Transformerベースのポリシーやメモリ拡張型強化学習が考えられる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Nitish Dashora, Douglas Chen, Idan Shenfeld, John Marangola, Pulkit Agrawal, Max Simchowitz

分類: cs.RO, cs.AI

原文アブストラクト

Complex robotic manipulation tasks frequently require a long-term memory of past events and actions. As conditioning on full histories renders policies prone to spurious correlations and degrades performance, many approaches to policy memory involve compressing historical information through expensive VLM queries in-the-loop to process only task-salient information. In this paper, we propose an alternative approach in which computationally intensive VLM queries are made during train-time to learn a lightweight latent memory that can be efficiently queried at deployment time. Our representation, which we call the \textbf{workspace token}, is trained by (1) using a VLM to identify current and historical information necessary for completing a task, then (2) distilling these into the workspace token using a set-reconstruction decoder loss. In both simulation and hardware, we show that the workspace token can be used as a drop-in replacement for observations during deployment, enabling policies to solve memory-intensive tasks without the need for VLM reasoning in-the-loop. Interestingly, we found that workspace tokens are not only more lightweight but also lead to better policy performance.

関連論文

PR本紙発行元 EmplifAI