日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
自動運転/VLAarXiv:2608.13395v1

FIRE-VLA: 自動運転における視覚言語行動モデルの失敗情報に基づく自己進化

FIRE-VLA: Failure-Informed Self-Evolution for Vision-Language-Action Models in Autonomous Driving

シェア:XThreadsFacebookLINEはてブBluesky

自動運転のVLAモデルに対し、失敗した軌道を教師信号として活用する自己進化フレームワークを提案し、評価時の失敗率と誤差を低減した。

詳しい要約

1. どんなもの?

FIRE-VLAは、自動運転向けVision-Language-Action (VLA)モデルの強化学習における失敗情報を活用した自己進化フレームワークである。従来のGroup Relative Policy Optimization (GRPO)では、各ロールアウトグループ内の報酬差のみから学習するため、全軌道が不良な場合に失敗領域外の行動を特定できない。FIRE-VLAは、低報酬かつ低多様性のグループに対して、凍結されたラウンド開始時点の同一モデルからの自己蒸留をトリガーし、失敗を次のポリシーへの特権的監督に変換する。教師と生徒は同じパラメータ規模だが、教師のみが隠れた未来軌道を観測できる。蒸留は生徒の生成プレフィックスに従い、回答トークンのみに制限され、GRPOは全グループで有効のままである。更新されたポリシーが次のラウンドの教師となり、失敗分布をポリシーとともに変化させる。

2. 先行研究と比べてどこがすごい?

先行研究のGRPOは、報酬の相対差のみを用いるため、全軌道が不良な場合に失敗のランク付けはできても、失敗領域外の行動を特定できない。FIRE-VLAは、この未解決の失敗を自己蒸留による特権的監督に変換することで、外部の大規模教師を必要とせずに失敗情報を活用する点が新しい。また、教師と生徒が同一スケールであり、教師のみが未来軌道を観測する点で、従来の自己蒸留や模倣学習と異なる。

3. 技術・手法の肝は?

手法の核は、低報酬・低多様性グループの検出と、それに対する自己蒸留の適用である。具体的には、各グループの報酬と多様性を評価し、条件を満たす場合に、ラウンド開始時の凍結モデルを教師として、生徒の生成プレフィックスに沿って回答トークンのみに損失を制限して蒸留する。GRPOは全グループで並行して適用され、ポリシー更新後は教師を更新する。これにより、失敗分布がポリシーとともに変化し、外部教師なしで自己進化が可能となる。

4. どうやって有効だと検証した?

Qwen2.5-VL-3B SFTチェックポイントを初期値とし、生徒のロールアウトとポリシー更新回数を一致させた比較を行った。150シーンのnuScenesから抽出した6,019例で評価し、単一サンプル計画性能は同等を維持しつつ、G=4の平均L2誤差を1.848mから1.500mに低減し、評価持続失敗率を13.03%から11.20%に低下させた。平均誤差の低減は主に稀な重大なロールアウトの改善によるもので、通常軌道の一様な改善ではないことを示した。

5. 議論はある?

要旨からは、平均誤差の改善が主に稀な重大なロールアウトに起因するという点が議論として挙げられる。これは、通常軌道の性能がほぼ変わらない一方で、極端な失敗事例が改善されたことを示唆する。また、自己蒸留のトリガー条件や、教師と生徒の同一スケールでの蒸留の有効性についての詳細な分析は要旨からは不明である。さらに、提案手法が他のVLAモデルやデータセットでどの程度汎化するかは不明である。

6. 次に読むべき論文は?

要旨で参照されているGRPO (Group Relative Policy Optimization) や、基盤となるQwen2.5-VLモデル、nuScenesデータセットに関する論文が関連する。また、自己蒸留や失敗情報を活用した強化学習の手法として、Self-DistillationやFailure-Aware Learningに関する研究が挙げられる。具体的には、GRPOの原論文、Qwen2.5-VLの技術報告、nuScenesのデータセット論文を次に読むことが推奨される。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Hao Dou

分類: cs.RO

原文アブストラクト

Reinforcement learning improves autonomous-driving vision-language-action (VLA) models by evaluating trajectories sampled from the current policy. Group relative policy optimization (GRPO) learns from reward differences within each rollout group. When all sampled trajectories are poor, this relative signal can rank failures without identifying behavior outside the failed region. We introduce FIRE-VLA, a failure-informed self-evolution framework that converts such unresolved failures into privileged supervision for the next policy. Low-reward, low-diversity groups trigger self-distillation from a frozen round-start copy of the same model. Teacher and student have the same parameter scale, but only the teacher observes the hidden future trajectory. Supervision follows the student's generated prefix and is restricted to answer tokens, while GRPO remains active for every group. The updated policy supplies the teacher for the next round, allowing the routed failure distribution to change with the policy without requiring a larger external teacher. Starting from the same Qwen2.5-VL-3B SFT checkpoint, the comparison matches student rollout and policy-update counts. On 6,019 examples from 150 held-out nuScenes scenes, FIRE-VLA retains comparable single-sample planning, reduces G=4 mean L2 from 1.848 to 1.500 m, and lowers evaluation-persistent failure prevalence from 13.03% to 11.20%. The reduction in mean error arises mainly from rare severe rollouts rather than uniform improvement across ordinary trajectories.