何が起きたか

arXiv掲載の論文「PAIR: Bridging Perception and Action in Vision-Language-Action Models」は、視覚観測と自然言語指示から連続ロボット動作を生成するVision-language-action(VLA)モデルに対し、知覚と行動の間に共有中間表現を学習する枠組みPAIRを提案した。論文は2026-10-06に掲載された。評価では、LIBERO-PlusでVLA-Adapterの成功率を59.1%から64.2%に引き上げ、CALVINでは平均完了列長を4.42から4.53に改善した。

詳細

訓練時、PAIRはMasked Action Autoencoderで専門家の行動チャンクをhorizon-alignedなAction Latent Tokensへ符号化し、Bridge Moduleが現在の視覚・言語表現から課題関連特徴を抽出する。その後、これらをAction Latent Tokensに整合させてBridge Tokensを作り、action-token空間に投影して初期Action Tokensへ注入する設計である。推論時にはautoencoderを取り外し、Bridge Tokensは現在の観測と指示のみから生成される。 実験はLIBERO、LIBERO-Plus、CALVIN ABC-Dで行われ、OpenVLA-OFTとVLA-Adapterの両方で改善が報告された。さらに7つの実世界タスクで、PAIRはOpenVLA-OFTの成功率を51.4%から65.0%へ引き上げた。表現解析では、Bridge Tokensが課題情報を保ちながら、Action Expertによる精緻化の前に連続動作情報へアクセス可能にすることが示された。

Key Facts

論文名は「PAIR: Bridging Perception and Action in Vision-Language-Action Models」である。[1]
論文は2026-10-06にarXivで掲載された。[1]
PAIRは知覚と行動の間に共有中間表現を学ぶ枠組みである。[1]
LIBERO-PlusでVLA-Adapterの成功率は59.1%から64.2%に上昇した。[1]
7つの実世界タスクでOpenVLA-OFTの成功率は51.4%から65.0%に上昇した。[1]

本紙の見方

PAIRの新しさは、VLAの連続動作生成でしばしば暗黙だった「知覚表現から行動表現への移行」を、Bridge Tokensという共有中間表現として明示的に切り出した点にある。既存のVLAが最終的な行動予測損失でまとめて学習していたのに対し、本手法は専門家行動のチャンクをAction Latent Tokensに符号化し、それと視覚・言語特徴を整合させてから初期Action Tokensへ渡す。つまり、入力の観測と言語、行動生成、さらにAction Expertによる精緻化を一本の連結構造として扱っている。 本紙の見方では、ここで重要なのは性能向上そのものより、どの段階の表現がボトルネックだったかを設計で特定している点である。LIBERO-PlusではVLA-Adapterが59.1%から64.2%へ、CALVINでは平均完了列長が4.42から4.53へ、7つの実世界タスクではOpenVLA-OFTが51.4%から65.0%へ改善した。対象モデルと環境が異なる中で一貫して上振れしているため、Bridge Tokensが単なる補助特徴ではなく、観測から行動に移る際の表現ギャップを埋める役割を持つ可能性がある。ただし、論文に示されたのは評価済みモデルでの結果であり、どの条件で再現性が落ちるかは未確定である。 業界構造の面では、この提案はロボット制御を「視覚認識モデル+言語理解モデル+行動ポリシー」の単純な接続ではなく、中間表現の設計問題として捉え直す。訓練時だけautoencoderを使い、推論時はBridge Tokensを観測と指示から直接生成するため、実運用で必要な計算経路と学習時の表現学習を分けている点も実装上の論点である。今後確認すべきなのは、別のVLAや別領域のロボットタスクでも同じ改善幅が出るか、Action Expertの寄与がどの程度か、そしてBridge Tokensが実機環境でどのような失敗モードを持つかである。

なぜ重要か

VLAを使うロボットでは、観測と言語を受けてすぐ動作を出すだけでなく、行動に直結する中間表現をどう作るかが性能差になり得ることを、この論文は示している。ARXIV掲載の評価では、複数ベンチマークと実世界タスクで成功率や完了列長の改善が示されており、設計の焦点が最終出力だけでなく表現の橋渡しにあると分かる。

日本への影響

日本企業や研究機関がVLA型ロボットを扱う場合も、視覚・言語・行動の接続をどの中間表現で設計するかが論点になるとみられる。特に、実機タスクを持つ開発では、訓練時のautoencoderと推論時の直接生成を分けるこの構造が、計算資源や評価手順の設計に影響し得る。