何が起きたか
arXivに2026年8月16日付で公開された論文「Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning」において、Internalized Visual Thinking (IVT) というポストトレーニング手法が提案された。IVTは、未ラベルの動画を用いてテキスト予測と次埋め込み予測を同時に最適化し、部分観測された動画から未来フレームの潜在表現とテキスト回答を予測する。推論時には未来フレームの合成や再エンコードを行わずに直接回答を生成する。
詳細
従来のVisual CoTは、推論時に中間的な推論画像を生成することで空間的・時間的・身体的な環境の推論を可能にするが、推論オーバーヘッドが大きいという問題があった。IVTは、訓練中に視覚的思考を内面化することで、推論時には直接回答を生成する。 論文では、ターゲット表現、デコーダ設計、予測ホライズン、データ混合、訓練カリキュラム、予測目的関数にわたる対照実験が行われた。IVTは、直接回答のファインチューニングと比較して、6つの評価設定すべてで性能を向上させた。また、明示的なVisual CoTと比較して、同等以上の性能を達成しつつ、平均エンドツーエンド遅延を5倍以上削減した。
Key Facts
| 論文「Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning」がarXivに2026年8月16日付で公開された。 | [1] |
| IVTは、未ラベルの動画を用いてテキスト予測と次埋め込み予測を同時に最適化するポストトレーニングフレームワークである。 | [1] |
| IVTは、部分観測された動画から未来フレームの潜在表現とテキスト回答を予測する。 | [1] |
| IVTは推論時に未来フレームの合成や再エンコードを行わずに直接回答を生成する。 | [1] |
| IVTは直接回答のファインチューニングと比較して、6つの評価設定すべてで性能を向上させた。 | [1] |
| IVTは明示的なVisual CoTと比較して、同等以上の性能を達成し、平均エンドツーエンド遅延を5倍以上削減した。 | [1] |
| 論文は、推論時の明示的なピクセル空間生成は効果的なプロアクティブ動画推論に必ずしも必要ではないと示唆している。 | [1] |
なぜ重要か
IVTは、動画推論における推論コストの削減と性能向上を両立する可能性を示す。推論時の画像生成を不要にすることで、リアルタイム性が求められるプロアクティブ動画推論の実用化に寄与すると考えられる。