何が起きたか

arXivに2026-09-28付で掲載された論文「Learning to Act under Visual Interruptions with Vision-Language-Action Models」は、VLAモデルがタスク実行中に一部カメラのフレームを失った場合でも動作を続けられるかを扱った。論文は、この問題を評価するベンチマーク「MAIL-Bench」と、視覚入力が欠けた状態で機能を保つための手法「MINT」を提案している。さらに、π_{0.5}、GR00T N1.5、AgiBot G2での実験結果として、カメラ喪失下でのタスク成功率が元モデルより改善したとしている。

詳細

MAIL-Benchは、各ポリシーの成功した参照軌跡の複数段階でカメラを遮断し、視覚入力が使えない状況でのポリシー性能を測る設計である。MINTは推論時に、光フローの外挿か、行動条件付きのworld modelで欠損した観測を補い、予測ビューが信頼できなくなった場合にはその利用を外す。 論文はまた、MINTがまずVLAポリシーを「欠損した視覚入力の下でも機能する」よう学習させる点を述べている。実験対象として挙げられているのはπ_{0.5}、GR00T N1.5、AgiBot G2であり、AgiBot G2ではカメラ喪失下での実機デプロイも示したとしている。

Key Facts

論文名は「Learning to Act under Visual Interruptions with Vision-Language-Action Models」である。[1]
掲載日は2026-09-28で、媒体はarXivである。[1]
新ベンチマーク「MAIL-Bench」を導入し、カメラ遮断の条件でVLAモデルを評価する。[1]
手法「MINT」は、光フロー外挿または行動条件付きworld modelで欠損観測を補う。[1]
実験対象はπ_{0.5}、GR00T N1.5、AgiBot G2で、AgiBot G2では実機デプロイを示したとしている。[1]

本紙の見方

この論文の新しさは、VLAの精度そのものではなく、視覚入力が途中で欠けるという実運用上の断絶を評価対象にした点にある。既存のVLA研究は全カメラが使える前提で性能を測ることが多かったが、MAIL-Benchは参照軌跡の複数段階でカメラを止め、閉ループ制御の頑健性を問う設計である。つまり主役は「より賢い認識」ではなく、「視覚が不完全でも行動を継続できるか」というロボット制御の条件設定だとみられる。 MINTの構成も、この論文の含意を分かりやすくしている。推論時に光フロー外挿か行動条件付きworld modelで欠損視点を補う一方、予測ビューが不確実になれば引き下げるという二段構えであり、単なる欠損補完ではなく、補完の採否まで含めて制御に織り込んでいる。これは、センサーが完全である前提のモデルから、入力の信頼度を扱うモデルへと焦点が移っていることを示す。AgiBot G2で実機デプロイまで示した点からも、論文がシミュレーション上の頑健性だけでなく、現場でのカメラ喪失を想定した運用層に踏み込んでいることが読み取れる。 業界構造への含意としては、ロボット学習の評価軸がタスク成功率だけでなく、センサー欠損時の挙動、予測ビューの扱い、world modelの信頼性に移る可能性がある。未確定の論点は、MAIL-Benchの具体的な評価規模、カメラ遮断の条件分布、MINTの改善幅の数値、そして実機での失敗条件がどこにあるかである。

なぜ重要か

論文が示すのは、VLAロボットにとって重要なのが通常時の認識精度だけではなく、カメラ喪失時に動作を継続できるかだという点である。発表元のarXivは、MAIL-Benchで複数段階の視覚中断を評価し、MINTがπ_{0.5}、GR00T N1.5、AgiBot G2で改善を示したとしている。