何が起きたか
arXivは2026-09-17、論文「Catch Me If You Can: Real-Time Feedback Denoising for Responsive VLAs」を公開した。論文は、Vision-Language-Action(VLA)モデルのために、推論後に一括で行う従来のオープンループ実行ではなく、最後のデノイジング段階を軽量なフィードバック口として残す「VLA-Feedback」を提案している。著者らは、各アクションを実行直前の最新観測で補正できる設計だとしている。
詳細
VLA-Feedbackは、低頻度の拡散計画と高頻度の視覚フィードバックを組み合わせる二つの時間スケールの構成である。拡散型の行動生成器は時系列的にまとまりのある行動チャンクを表現する一方、実行時の環境変化に対しては柔軟さが不足しやすいとしている。 論文では、静的なLIBEROタスクでGR00Tと同等の結果を示し、動的シミュレーションタスクでは平均成功率が27.5%から85.0%に、実機タスクでは51%から73%に改善したとしている。
Key Facts
| arXivは2026-09-17に「Catch Me If You Can: Real-Time Feedback Denoising for Responsive VLAs」を公開した。 | [1] |
| 論文は、VLA-Feedbackという二つの時間スケールのアーキテクチャを提案している。 | [1] |
| VLA-Feedbackは、低頻度の拡散計画と高頻度の視覚フィードバックを組み合わせる設計である。 | [1] |
| 動的シミュレーションタスクでの平均成功率は27.5%から85.0%に改善した。 | [1] |
| 実機タスクでの平均成功率は51%から73%に改善した。 | [1] |
本紙の見方
この論文の新しさは、VLAの推論を「一度生成して終わり」にせず、最後のデノイジング段階を実行直前の修正口として残した点にある。拡散型の行動生成は時間的整合性のある行動チャンクを作れる一方、実行中の物体移動や接触変化への追従は弱い。VLA-Feedbackはこの弱点に対し、計画と実行を二つの時間スケールに分離している。既存の拡散計画を捨てるのではなく、表現力を保ったまま応答性を足した構成だと読める。 本紙の関連記事はないため、過去報道との連続性は直接は置けない。ただし、論文内で静的LIBEROではGR00Tと同等でありながら、動的シミュレーションと実機で改善幅が大きい点は重要である。つまり、静止物体のベンチマークだけでは優劣が見えにくく、環境変化を含む条件で初めて差が出る設計だとみられる。ここからは、VLAの評価軸が「初回生成の精度」から「実行中にどれだけずれを戻せるか」へ移っているかが焦点になる。 業界構造への含意としては、ロボットの学習データだけでなく、実行時に使う最新観測の取り込み方が性能差を左右しやすいことを示す。拡散モデルの計画と視覚フィードバックの接続部分がボトルネックになれば、同じ基盤モデルでも制御方式で結果が変わるためである。また、実機で51%から73%へ改善したことは、シミュレーションの改善がそのまま実機へ写るかどうかを確認する必要があることも示す。現時点で未確定なのは、どのロボット形態にどこまで一般化するか、フィードバックの計算遅延をどの程度許容できるか、学習時にどのようなデータを使ったかである。 要するに、この論文はVLAを「生成モデル」だけでなく「閉ループ制御」に近づける試みであり、今後は成功率の数字だけでなく、実行遅延と環境変化への追従性を含めた評価が必要になるとみられる。
なぜ重要か
VLAを実機に使う場合、行動を出した後に対象物が動くと、オープンループのままでは失敗しやすい。論文は、実行直前に最新観測で補正する設計によって、動的シミュレーションと実機の成功率が上がる可能性を示した。
日本への影響
日本のロボット研究や実機評価では、静的ベンチマークだけでなく、接触や対象物移動を含む閉ループ評価の比重が高まる可能性がある。とくに、実機タスクで51%から73%へ改善した点は、制御系と視覚フィードバックの遅延設計が性能に直結することを示しており、日本側でも学習モデルだけでなく実行系の設計が論点になりやすい。