何が起きたか

2026年6月4日にarxiv.orgで公開された論文「DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models」において、連続値出力を必要とするタスク向けに、事前学習済みVLMを適応させるフレームワーク「DRIFT」が提案された。DRIFTは、粗い予測を行うベース予測器と、フローマッチングに基づく生成的改良モジュールを組み合わせ、視覚グラウンディングとロボット制御の両方で評価され、複数のタスクとアーキテクチャにわたり、回帰ベースおよび生成ベースの既存手法を一貫して上回ったと報告されている。

詳細

DRIFTは、事前学習済みのVLMを連続値出力タスクに適応させるための一般的なフレームワークである。具体的には、対象出力の粗い推定を提供するベース予測器と、フローマッチングに基づく生成的な改良モジュールを組み合わせ、予測を反復的に改善する。この残差定式化により、生成モデリングの問題を、大域的な出力分布の学習から、強い事前分布の周りの局所的な残差分布のモデリングへと変換し、最適化を大幅に単純化する。評価は、視覚グラウンディングとロボット制御を含む知覚および計画タスクで行われ、MLLM、VLA、WAMなどの複数のアーキテクチャにわたって、DRIFTは回帰ベースおよび生成ベースの強力なソリューション群を一貫して上回ったとされる。

Key Facts

DRIFTは、事前学習済みVLMを連続値出力タスクに適応させるための一般的なフレームワークである。[1]
DRIFTは、粗い予測を提供するベース予測器と、フローマッチングに基づく生成的な改良モジュールを組み合わせる。[1]
DRIFTは、視覚グラウンディングとロボット制御を含む知覚および計画タスクで評価された。[1]
DRIFTは、MLLM、VLA、WAMなどの複数のアーキテクチャにわたって、回帰ベースおよび生成ベースのソリューション群を一貫して上回ったと報告されている。[1]

本紙の見方

今回のDRIFTの提案は、VLMの出力インターフェースを離散トークンから連続値へ拡張する試みとして位置づけられる。既存のVLMはテキスト生成に最適化されており、イベントの時間的境界の特定やロボット制御アクションの生成といった精密な連続出力を必要とするタスクには不向きとされる。DRIFTは、ベース予測器による粗い推定とフローマッチングによる残差生成を組み合わせることで、このギャップを埋める。このアプローチは、大域的な出力分布を直接学習するのではなく、強い事前分布の周りの局所的な残差分布をモデリングする点に特徴があり、最適化の難しさを軽減する。 本紙の過去報道との接続は、関連記事が提供されていないため直接的な言及は避けるが、VLMの応用範囲を拡張する研究の流れの一部とみられる。特に、ロボット制御への応用は、物理AIの分野で注目される領域であり、DRIFTがVLAやWAMなどのアーキテクチャで有効とされる点は、今後のロボット学習の手法に影響を与える可能性がある。 業界構造への含意としては、DRIFTのようなフレームワークが普及すれば、VLMを連続値出力タスクに適用する際の開発コストが低下し、ロボット制御や時系列イベント検出などの分野での応用が加速する可能性がある。また、フローマッチングを用いた生成モデルの活用は、既存の回帰ベースの手法に代わる選択肢として、モデル設計の多様性を高める。 未確定の論点としては、DRIFTの実装詳細や計算コスト、実世界のロボット制御タスクでの実証結果が論文からは不明であり、今後の検証が待たれる。また、DRIFTがどの程度の規模のモデルで効果を発揮するのか、また、他の連続出力タスクへの汎用性も確認が必要である。

なぜ重要か

DRIFTは、VLMの適用範囲を連続値出力タスクに拡張する可能性を示すものであり、ロボット制御やイベント検出など、精密な出力を必要とする分野でのAI活用を後押しする。フローマッチングを用いた残差生成という手法は、今後のモデル設計に新たな選択肢を提供し、物理AIの進展に寄与する可能性がある。