日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
マニピュレーションarXiv:2610.01698

ActiveWAM: 世界行動モデルのための証拠認識型能動視覚

ActiveWAM: Evidence-Aware Active Vision for World-Action Models

シェア:XThreadsFacebookLINEはてブBluesky

カメラとエンドエフェクタを同時に制御し、タスクに重要な証拠を保持しつつ新たな視点を取得する能動視覚マニピュレーションを、世界モデルと行動モデルを統合した枠組みで学習する手法を提案。

詳しい要約

1. どんなもの?

Active vision manipulation において、camera と end-effector の両方を制御する policy を扱う研究。camera 動作が有限の観測窓で見える evidence を左右するため、新視点取得は task-critical cue を失わせ、視点保持は有用な観測を逃すという retain-acquire 問題を定式化。これを evidence-aware retain-acquire problem と呼び、観測と操作を jointly 学習する unified world-action model である ActiveWAM を提案。deployment 時は view-aware history から bimanual と pan/tilt の action(stay や reacquisition を含む)を生成し、新たに測定した RGB 観測で context を更新する。

2. 先行研究と比べてどこがすごい?

従来の world-action model や active vision 手法と比べ、test-time inversion や candidate ranking を不要にした点が新しい。training-time inversion により frozen video prior を task-bearing source evidence と visible temporal changes で制約する。また future-video prediction を co-training signal として使いつつ、action 生成には future-video decoding も optimal viewpoint annotation も要らない。TAVIS の out-of-distribution success を最強 baseline 比で最大 17.0 percentage points 改善し、RoboTwin-AV では Fast-WAM より 20.0 points、real-world physical kitchen tasks では 26.7 poi…

3. 技術・手法の肝は?

中核は training-time inversion。frozen video prior を task-bearing source evidence と visible temporal changes で制約し、test-time inversion や candidate ranking を排除する。policy は view-aware history から bimanual と pan/tilt の action(stay と reacquisition を含む)を生成し、新規 RGB 観測で context を更新。future-video prediction は co-training signal として用いるが、action 生成時に future-video decoding や optimal viewpoint annotation は不要。観測と操作を jointly 学習する unified world-action model として構成。

4. どうやって有効だと検証した?

RoboTwin-AV という 50-task benchmark を導入。executable pan/tilt control と自動生成 demonstration を備える。TAVIS の out-of-distribution success で最強 baseline 比最大 17.0 percentage points 改善。RoboTwin-AV で Fast-WAM より 20.0 points 上回り、real-world physical kitchen tasks では 26.7 points 上回ることを示した。

5. 議論はある?

camera motion が有限観測窓内の evidence を左右するため、新視点取得と視点保持のトレードオフ(retain-acquire)が本質的課題。training-time inversion により test-time の計算負荷や candidate ranking を回避できる点が利点。future-video prediction を co-training に使いつつ action 生成に future-video decoding や optimal viewpoint annotation を要さない設計。ただし要旨からは、失敗事例や限界、計算コスト、汎化性の詳細な議論は不明。

6. 次に読むべき論文は?

要旨で参照・比較されている TAVIS、Fast-WAM、および world-action model 系の研究。active vision manipulation や video prior を用いた policy 学習、RoboTwin 系 benchmark も関連。要旨に明示的な次論文指定はないため、同分野の定番として world model ベースの manipulation policy や active perception の研究を挙げる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Renjun Wu, Luzhou Ge, Xuesong Li

分類: cs.RO

原文アブストラクト

Active vision manipulation requires a policy to control both its camera and its end-effectors, yet camera motion determines which evidence remains visible within finite observation windows. Acquiring a new view can displace task-critical cues, while retaining a view forgoes potentially useful observations. We formulate this as an evidence-aware retain--acquire problem and present ActiveWAM, a unified world--action model that learns observation and manipulation jointly. To this end, we propose training-time inversion which constrains a frozen video prior by task-bearing source evidence and visible temporal changes, eliminating the need for test-time inversion or candidate ranking. At deployment, the policy generates bimanual and pan/tilt actions-including stay and reacquisition behaviors-from view-aware history, and updates context from newly measured RGB observations. Future-video prediction serves as a co-training signal, while action generation requires neither future-video decoding nor optimal viewpoint annotations. We introduce RoboTwin-AV, a 50-task benchmark with executable pan/tilt control and automatically generated demonstrations. ActiveWAM improves TAVIS out-of-distribution success by up to 17.0 percentage points over the strongest baselines, achieves 20.0 additional points over Fast-WAM on RoboTwin-AV, and outperforms it by 26.7 points on real-world physical kitchen tasks.

関連論文

PR本紙発行元 EmplifAI