日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
マニピュレーションarXiv:2608.30880v1

Zeva: 文脈内因果学習による汎用身体操作の実現

Zeva: In-Context Causal Learning for Generalizable Embodied Manipulation

シェア:XThreadsFacebookLINEはてブBluesky

ロボットが実環境での物理的相互作用からその場で学習し、その知識を次の行動に活かすフレームワークZevaを提案。ポリシーモデルを凍結したまま、因果相互作用抽出器と二重タイムスケールの因果メモリを用いて、実行した行動と状態変化を符号化し、後の行動の文脈として注入する。シミュレーションと実機操作で最先端のVLAやWAMを上回る性能を示し、勾配更新なしで自己進化を実現。

詳しい要約

1. どんなもの?

Zevaは、ロボットが実世界展開中に自身の物理的インタラクションからオンザフライで学習し、その知識をその後の行動に活用することを可能にする、初のフレームワークである。ポリシーモデルを凍結したまま、ロボット自身の物理的インタラクション経験からのin-context learningを実現する。Causal Interaction Extractorを用いて実行されたアクションとその誘発された状態変化を因果的インタラクション信号にエンコードし、二重タイムスケールの因果メモリに格納する。その後のアクションのために、関連する因果的インタラクション信号をメモリから取得し、凍結されたポリシーモデルにコンテキストとして注入する。

2. 先行研究と比べてどこがすごい?

先行研究は主に事前学習による汎化を目指していたが、実世界の未知の物理的条件に対処するには不十分だった。Zevaは、展開中にロボット自身のインタラクションから学習する点で優れている。また、ポリシーモデルを凍結したままin-context learningを実現する点が新しい。比較対象の最先端のVLAやWAMと比較して、シミュレーションと実世界操作の両方で最高の性能を達成し、勾配更新なしで自己進化を可能にする。

3. 技術・手法の肝は?

手法の肝は、Causal Interaction Extractorとdual-timescale causal memory、そして凍結されたポリシーモデルへのコンテキスト注入である。Causal Interaction Extractorは、実行されたアクションとその結果生じた状態変化を因果的インタラクション信号としてエンコードする。この信号は、短期と長期の二つのタイムスケールで管理される因果メモリに格納される。行動選択時には、関連する信号がメモリから取得され、ポリシーモデルにコンテキストとして与えられる。これにより、モデルパラメータを更新せずに経験を活用できる。

4. どうやって有効だと検証した?

シミュレーションと実世界の操作タスクで実験を行い、比較対象の最先端のVLAおよびWAMと比較して最高の性能を達成した。さらに、展開中にロボットがインタラクション経験を蓄積するにつれて成功率が継続的に向上することを示し、自己進化が可能であることを実証した。また、獲得したインタラクション経験がタスク間で汎化することも示した。

5. 議論はある?

要旨からは、議論の詳細は不明である。ただし、in-context learningの枠組みがポリシーモデルの凍結を前提としているため、モデルの表現力やスケーラビリティに関する議論が考えられる。また、因果メモリの容量や取得機構の効率性、実世界でのノイズや不確実性への頑健性などが議論の対象となる可能性がある。

6. 次に読むべき論文は?

要旨で参照されている比較対象のVLA (Vision-Language-Action models) やWAM (World Action Models) に関する論文が次に読むべきである。具体的には、VLAの代表例としてRT-2やPaLM-E、WAMの代表例としてUniPiやSUPなどが考えられる。また、in-context learningの関連研究として、Transformerベースのアーキテクチャやメモリ拡張ニューラルネットワークの研究も有用である。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Fu Chen, Xin Ding, Bingjia Huang, Xiangyu Li, Mingju Wang, Jiawei He, Kun Li, Wei Sun, Yunxin Liu, Hao Wu, Ting Cao

分類: cs.RO

原文アブストラクト

Generalizable embodied manipulation remains difficult to achieve through pretraining alone, due to unseen physical conditions in the real world. We argue that robots need to learn from their own physical interactions on the fly during real-world deployment and use this knowledge to inform subsequent actions. We present Zeva, the first framework that enables in-context learning from a robot's own physical interaction experience while keeping the policy model frozen. Zeva employs a Causal Interaction Extractor to encode an executed action and its induced state change into a causal interaction signal, which is stored in a dual-timescale causal memory. For subsequent actions, relevant causal interaction signals are retrieved from memory and injected into the frozen policy model as context. Experiments in simulation and real-world manipulation demonstrate that Zeva achieves the best performance among the compared frontier VLAs and WAMs and, more importantly, enables self-evolution during deployment without gradient updates. Its success rate continues to improve as the robot accumulates interaction experience. Furthermore, the acquired interaction experience can generalize across tasks.

関連論文