何が起きたか

arXivは2026年9月24日、論文「World Action Agent: Harnessing VLMs for Robot Manipulation via World Action Rehearsal」を掲載した。論文は、視覚言語モデル(VLM)をロボット操作に使うための多主体枠組み「World Action Agent(WAA)」を提案している。WAAは、行動の提案を編集可能な形で事前に見直す「action rehearsal」、観察と実行をつなぐ「in-view correction」、技能を蓄積して参照する仕組みを備える。

詳細

論文によると、WAAの視覚的行動ワークスペースは3つの性質を持つ。第1に、シーン形状から自動選択される「contact views」により、現在の接触対象まわりの दृश्यを提示する。第2に、各行動を編集可能な提案に変換する「action rehearsal」により、エージェントは実行前に計画フィードバックを踏まえて見直せる。第3に、「in-view correction」が観察、リハーサル、低レベル実行を閉ループで結ぶ。

Key Facts

arXivは2026年9月24日に「World Action Agent: Harnessing VLMs for Robot Manipulation via World Action Rehearsal」を掲載した。[1]
WAAはVLMをロボット操作に使う多主体の枠組みである。[1]
WAAのワークスペースはcontact views、action rehearsal、in-view correctionの3要素を持つ。[1]
LIBERO-Proでは、LIBERO-90由来の技能のみで学習したWAAが平均成功率75.6%を記録した。[1]
Qwen3.5-9Bをハーネスの軌跡で微調整すると、域外成功率は1.7%から43.3%に上がった。[1]

本紙の見方

この論文の新しさは、VLMを「見て指示する」段階にとどめず、視覚的な行動ワークスペースの中で提案・修正・実行の往復を回す点にある。既存のVLM活用は、制約推定やプログラム生成に寄せるもの、あるいは単にシーンを見せるものに分かれていたが、WAAはその中間に「行動のリハーサル」という編集可能な層を置いた。ここが本件の主軸であり、単なる認識精度ではなく、実行前の修正可能性を操作性能に結びつけている。 本紙の関連記事はないが、論文内の構成から読むべき点は明確である。WAAは、接触対象の周辺を自動で切り出すcontact views、行動案を事前検証するaction rehearsal、誤差を観測位置で補正するin-view correctionを連結しており、知覚から計画、低レベル実行までを一つの環境で閉じている。さらに、expert videosやhuman teachingから技能を進化させ、同じハーネス上のinteraction tracesで小型VLMを鍛えるとされるため、単発のモデル性能ではなく、技能の蓄積と再利用を前提にした設計とみられる。75.6%というLIBERO-Proの結果は、この設計が既存のend-to-end VLAやcode-as-policyよりも、少なくとも同条件では有効だったことを示す。 業界構造への含意としては、ロボット操作の評価軸が「単発の推論」から「行動をどれだけ修正可能にし、どれだけ技能として再利用できるか」へ移る点が大きい。WAAは大規模モデルそのものを置き換えるというより、VLMを既存の操作系に接続するためのハーネスとして機能しており、学習済み技能と実行ログが次の学習に回る循環をつくる。したがって競争の焦点は、基盤モデルの大きさだけでなく、接触視点の設計、リハーサルの評価方法、低レベル制御との接続精度に移る可能性がある。 未確定の論点は、LIBERO-Pro以外の実環境での再現性、技能の進化に使ったexpert videosやhuman teachingの規模、Qwen3.5-9B以外の基盤モデルでの挙動、そして「same skills remain effective on robosuite without further learning」の条件である。論文は有効性を示しているが、どの作業範囲まで汎用化できるか、どの程度のデータと計算で同じ構造を維持できるかは、今後の検証が必要である。

なぜ重要か

論文が示すのは、ロボット操作でVLMを使う際に、認識だけでなく行動を事前に見直せる枠組みが性能に効くという点である。LIBERO-Proの75.6%やQwen3.5-9Bの1.7%→43.3%という結果は、同じモデルでも接続の仕方で挙動が大きく変わることを示している。

日本への影響

日本企業や研究機関にとっては、VLM本体の大型化だけでなく、接触視点の設計、行動リハーサル、視点内補正のような実行系の設計が競争力の分岐点になりうる。とくにロボットの実機データを蓄積しながら技能を再利用する構成は、製造現場や研究環境での評価設計と近く、モデル単体より周辺の実装力が問われる。