何が起きたか

自動運転向け視覚言語行動(VLA)モデルの強化学習において、失敗情報を活用する自己進化フレームワーク「FIRE-VLA」が提案された。この手法は、低報酬・低多様性のグループに対して、凍結したラウンド開始時点のモデルから自己蒸留を行い、GRPOと併用する。評価では、平均L2誤差を1.848mから1.500mに低減し、持続的失敗率を13.03%から11.20%に改善した。

詳細

自動運転向けの視覚言語行動(VLA)モデルは、強化学習によって改善される。グループ相対方策最適化(GRPO)は、各ロールアウトグループ内の報酬差から学習するが、全てのサンプリング軌道が不良な場合、相対シグナルは失敗をランク付けするだけで、失敗領域外の行動を特定できない。 FIRE-VLAは、このような未解決の失敗を次のポリシーに対する特権的監督に変換する自己進化フレームワークである。低報酬・低多様性のグループは、同じモデルの凍結されたラウンド開始時点のコピーからの自己蒸留をトリガーする。教師と生徒は同じパラメータ規模であるが、教師のみが隠れた未来の軌道を観測できる。監督は生徒の生成プレフィックスに従い、回答トークンに制限される一方、GRPOはすべてのグループでアクティブのままである。更新されたポリシーは次のラウンドの教師を提供し、ルーティングされた失敗分布がポリシーとともに変化することを可能にする。 同じQwen2.5-VL-3B SFTチェックポイントから開始し、比較は生徒のロールアウトとポリシー更新回数を一致させている。150の保留されたnuScenesシーンからの6,019の例で、FIRE-VLAは同等の単一サンプル計画を維持し、G=4の平均L2を1.848mから1.500mに低減し、評価持続失敗率を13.03%から11.20%に低下させた。平均誤差の減少は、通常の軌道全体の一様な改善ではなく、まれな深刻なロールアウトに主に起因する。

Key Facts

FIRE-VLAは、自動運転向け視覚言語行動(VLA)モデルの自己進化フレームワークである。[0]
GRPOは各ロールアウトグループ内の報酬差から学習するが、全ての軌道が不良な場合、失敗領域外の行動を特定できない。[0]
FIRE-VLAは低報酬・低多様性のグループに対して、凍結されたラウンド開始時点のモデルから自己蒸留を行う。[0]
教師と生徒は同じパラメータ規模であるが、教師のみが隠れた未来の軌道を観測できる。[0]
監督は生徒の生成プレフィックスに従い、回答トークンに制限される。[0]
GRPOはすべてのグループでアクティブのままである。[0]
更新されたポリシーは次のラウンドの教師を提供する。[0]
同じQwen2.5-VL-3B SFTチェックポイントから開始し、比較は生徒のロールアウトとポリシー更新回数を一致させている。[0]
150の保留されたnuScenesシーンからの6,019の例で、FIRE-VLAはG=4の平均L2を1.848mから1.500mに低減した。[0]
評価持続失敗率は13.03%から11.20%に低下した。[0]

なぜ重要か

FIRE-VLAは、強化学習における相対報酬の限界を克服し、失敗情報を活用してポリシーを改善する新しい手法を提供する。外部の大規模教師モデルを必要とせず、自己蒸留によって失敗分布を適応的に変化させる点が特徴的である。実験結果は、まれな深刻なロールアウトの改善を通じて平均誤差を低減できることを示しており、自動運転の安全性向上に寄与する可能性がある。