何が起きたか
arXivに2025年10月18日付で掲載された論文『Do What You Say: Steering Vision-Language-Action Models via Runtime Reasoning-Action Alignment Verification』において、研究チームは推論型VLAモデルの実行時ポリシー制御手法を提案した。この手法は、モデルが生成する中間テキスト計画と行動の整合性を検証し、OODシナリオでの指示追従性能を向上させる。実験では、LIBERO-100の拡張版を用いて、行動合成タスクで従来手法比最大15%の性能向上を達成したと報告している。
詳細
提案手法は、推論型VLAモデルが生成するテキスト計画を利用し、複数の候補行動系列をサンプリングしてシミュレーションで結果を予測し、事前学習済みVLMを用いて計画と最も整合する系列を選択する。これにより、モデルの行動多様性を誤り源から強みに転換し、意味的・視覚的OOD摂動に対するロバスト性を高め、再学習なしで新規行動の合成を可能にする。 研究チームは、OOD評価用に環境変動を加えたLIBERO-100の推論注釈付き拡張版も提供しており、プロジェクトウェブサイトで公開している。
Key Facts
| 論文はarXivに2025年10月18日付で掲載された(ソース0) | [1] |
| 提案手法は訓練不要で実行時ポリシー制御を行う(ソース0) | [1] |
| 複数の候補行動系列をサンプリングし、シミュレーションで結果を予測する(ソース0) | [1] |
| 事前学習済みVLMを用いてテキスト計画と最も整合する系列を選択する(ソース0) | [1] |
| LIBERO-100の推論注釈付き拡張版を提供する(ソース0) | [1] |
| 行動合成タスクで従来手法比最大15%の性能向上を達成した(ソース0) | [1] |
| プロジェクトウェブサイトはhttps://yilin-wu98.github.io/steering-reasoning-vla/(ソース0) | [1] |
なぜ重要か
この手法は、推論型VLAモデルの信頼性を向上させるものであり、ロボットの指示追従性能をOOD環境でも高める可能性を示す。再学習を必要としないため、実用的な展開が期待される。