何が起きたか

arXiv.orgは2026-10-01、論文「ActiveWAM: Evidence-Aware Active Vision for World-Action Models」を公開した。論文は、カメラの視点移動とエンドエフェクタ操作を同時に制御する能動視覚マニピュレーションを、証拠を意識した retain--acquire 問題として定式化した。著者らは、視覚観測と操作を共同学習する単一の world--action model を提案し、推論時の逆推論や候補順位付けを不要にするとしている。

詳細

論文では、訓練時に frozen video prior を課題に関わる source evidence と可視な時間変化で拘束する「training-time inversion」を提案し、テスト時の inversion や candidate ranking を不要にすると説明している。実行時には、視点を意識した履歴から bimanual および pan/tilt の行動、stay と reacquisition を含む動作を生成し、新たに得た RGB 観測で文脈を更新する。 評価面では、RoboTwin-AVという50タスクのベンチマークを新たに導入し、実行可能な pan/tilt 制御と自動生成デモを備えるとした。ActiveWAMはTAVISのout-of-distribution成功率で最強ベースラインを最大17.0ポイント上回り、RoboTwin-AVではFast-WAMに対して20.0ポイント、実世界の物理キッチンタスクでは26.7ポイント上回ったとしている。

Key Facts

ActiveWAMは、視覚観測と操作を共同学習する world--action model である。[1]
論文は、能動視覚マニピュレーションを evidence-aware retain--acquire 問題として定式化した。[1]
training-time inversion により、test-time inversion や candidate ranking を不要にするとしている。[1]
RoboTwin-AV は 50タスクのベンチマークで、実行可能な pan/tilt 制御と自動生成デモを備える。[1]
ActiveWAM は TAVIS の out-of-distribution 成功率で最大 17.0ポイント、RoboTwin-AV で Fast-WAM に対して 20.0ポイント、実世界の物理キッチンタスクで 26.7ポイント上回った。[1]

本紙の見方

今回の論文の新規性は、カメラを動かして「見る」ことと、エンドエフェクタを動かして「触る」ことを別々の問題として扱わず、有限の観測窓でどの証拠を残し、どの視点を取りに行くかを一体で解く点にある。ActiveWAMは、視点選択を単なる前処理ではなく、タスクに必要な証拠の保持と取得の問題として再定義している。ここで重要なのは、推論時に別途の逆推論や候補ランキングを挟まず、視覚履歴と新規RGB観測から直接行動を出す設計である。 本紙の見方としては、これはロボット政策の「計画」と「知覚」をつなぐ流れの延長線上にあるが、訓練時の inversion を frozen video prior への拘束として置いた点が特徴的である。つまり、動画事前知識をそのまま使うのではなく、課題に関わる証拠と時間変化で制約し、実行時の手続きを軽くしている。RoboTwin-AV の 50タスクや実世界の物理キッチンタスクでの評価を置いたことからも、論文の焦点は単なる視覚認識ではなく、視点制御を含む行動生成全体の安定化にあると読める。 業界構造への含意としては、まず評価基準の置き方が変わる点がある。従来は操作成功率だけを見がちだったが、この論文では pan/tilt を含む視点制御と、stay・reacquisition のような挙動まで政策に含めているため、データ収集、模倣学習、ベンチマーク設計のすべてに影響しうる。加えて、未来動画予測を co-training signal に使いながら、行動生成では future-video decoding を要しない構成は、計算資源の使い方を分ける設計思想を示す。実運用では、どの程度の視点再取得が必要か、RGB観測の更新頻度をどう決めるか、RoboTwin-AV 以外でも同様の差が出るかが次の確認点になる。

なぜ重要か

論文が示したのは、ロボットが作業対象を見失う局面を「失敗」として後処理するのではなく、視点制御そのものを政策に組み込む設計である。RoboTwin-AVの50タスクや実世界の物理キッチンタスクでの改善値は、視覚と操作を分離した手法との違いを具体的に示している。