日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VLAarXiv:2608.29967v1

言語フィードバックによるVLAモデル失敗の訓練不要な行動補正

Training-Free Action Correction for VLA Model Failures via Language Feedback

シェア:XThreadsFacebookLINEはてブBluesky

VLAモデルの実行時失敗を、再訓練なしにタスクレベルの自然言語補正で行動の大きさを調整して修正するフレームワークCorrectVLAを提案。シミュレーションと実ロボットで有効性を示し、修正可能な失敗の境界を明らかにした。

詳しい要約

1. どんなもの?

CorrectVLAは、Vision-Language-Action (VLA)モデルの実行時失敗を、再学習なしで修正するフレームワーク。人間がタスクレベルの自然言語による修正を与え、それをポリシーの重みを変えずに加法的なアクションの大きさの調整に変換する。単一のタスクレベルの修正を全ロールアウトに一様に適用し、エピソードごとの介入は行わない。シミュレーションと実ロボット(UFactory xArm7)で有効性を検証し、実行ミスアライメント(execution misalignment)失敗を修正できることを示す。

2. 先行研究と比べてどこがすごい?

従来のVLAモデルは強い意味理解を持つが、展開時に系統的な失敗を示す。その失敗条件や再学習なしでの修正可能性は十分に理解されていなかった。CorrectVLAは、推論時修正(inference-time correction)に焦点を当て、ポリシーの重みを変更せずにタスクレベルの言語フィードバックをアクション調整に変換する点で新しい。既存の手法が再学習やエピソードごとの介入を必要とするのに対し、単一のタスクレベル修正で全ロールアウトに適用できる点が優れている。

3. 技術・手法の肝は?

手法の肝は、タスクレベルの自然言語修正を加法的なアクションの大きさの調整に変換すること。具体的には、人間が与えた修正指示を解析し、ポリシーの出力アクションに加算する調整量を生成する。ポリシーの重みは変更しない。修正は全ロールアウトに一様に適用され、エピソードごとの介入は不要。失敗モードの分類(taxonomy)に基づき、実行ミスアライメント(正しいターゲットに到達するがアクションの大きさが不正確)が修正可能なサブセットであることを特定。

4. どうやって有効だと検証した?

シミュレーションでは、in-distributionおよびOODタスクで実行ミスアライメント失敗を回復。実ロボット実験では、環境シフト下のUFactory xArm7で、ベースポリシーがほぼ完全に機能しない状況でCorrectVLAがほぼ完璧な成功率を回復し、オブジェクトの位置やIDをまたいで一般化。さらに、LIBERO-90で失敗モードの分類を行い、修正可能な失敗と不可能な失敗を区別。

5. 議論はある?

議論として、CorrectVLAはポリシーが戦略的に正しい(strategic correctness)場合にのみ成功し、基本的な意味理解が欠如している場合(semantic comprehensionが崩壊)には失敗する。これにより、推論時修正の実用的な運用境界を確立。要旨からは、他の失敗モード(意味理解の崩壊)には適用できないことが示唆されるが、その詳細な分析は不明。また、単一のタスクレベル修正が全ロールアウトに適用されるため、タスク内のバリエーションに対する適応性に限界がある可能性も考えられるが、要旨からは不明。

6. 次に読むべき論文は?

要旨で参照されている研究は、VLAモデル、LIBERO-90、UFactory xArm7、および失敗モードの分類に関連するもの。具体的には、Vision-Language-Actionモデルの基礎研究、LIBEROベンチマーク、ロボット操作における言語フィードバックを用いた手法。次に読むべき論文としては、VLAモデルの元論文(例:RT-2、Octoなど)や、言語条件付きロボットポリシーの失敗分析、推論時修正に関する関連研究が挙げられる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Owen Kwon, Pablo Ortega-Kral, Arthur Bucker, Jean Oh

分類: cs.RO, cs.AI

原文アブストラクト

Vision-Language-Action (VLA) models demonstrate strong semantic understanding yet exhibit systematic failures during deployment. The conditions under which these failures occur, and whether they can be corrected without retraining, remain poorly understood. In this paper, we take steps toward addressing this gap. We present CorrectVLA, a framework that translates task-level natural language corrections into additive action magnitude adjustments without modifying policy weights. A human provides a single task-level correction, applied uniformly across all rollouts without per-episode intervention. In simulation, CorrectVLA recovers execution misalignment failures across both in-distribution and OOD tasks. In real-robot experiments on a UFactory xArm7 under environment shift, CorrectVLA restores near-perfect success where the base policy almost entirely breaks down, generalizing across object locations and identities. Through a taxonomy of failure modes on LIBERO-90, we find that execution misalignment failures, where the policy reaches the correct target but miscalibrates action magnitudes, represent the correctable subset, while other failure modes where semantic comprehension itself breaks down are not amenable to this approach. The approach succeeds when policies possess strategic correctness and fails when fundamental comprehension is absent, establishing a practical operational boundary for inference-time correction.

関連論文