何が起きたか

研究チームは、視覚言語モデルLLaVA-OneVision-2(LLaVA-OV-2)を発表した。同モデルは、圧縮動画をビットコストストリームとして扱うcodec-streamトークン化を導入し、限られたトークン予算をイベントを含むコンテンツに集中させる。8Bモデルは、新ベンチマークJumpScoreで74.9 mAPを達成し、Qwen3-VL-8Bの30.1を上回った。

詳細

LLaVA-OneVision-2は、ネイティブ解像度を維持しながら効率的な局所計算を行うWindowed Attentionを採用する。主要な進歩はcodec-streamトークン化で、圧縮動画を連続的なビットコストストリームとして扱い、ビットコストの動態に基づいて適応的な時間グループを形成し、動きの残差手がかりを用いて重要な空間情報を選択する。これにより、固定グループよりも長尺動画のトークン圧縮が安定するという。また、共有3D RoPEにより、codecキャンバス、サンプリングフレーム、画像を統一された時空間座標系に配置する。学習には、約800万の再キャプション済み動画サンプルと400万サンプルの空間コーパスを使用する。さらに、高頻度で密に反復する動きに焦点を当てた時間的ローカライゼーションのベンチマークJumpScoreを導入した。

Key Facts

LLaVA-OneVision-2は、codec-streamトークン化を導入し、圧縮動画をビットコストストリームとして扱う。[1]
LLaVA-OneVision-2-8BはJumpScoreで74.9 mAPを達成し、Qwen3-VL-8Bの30.1を上回った。[1]
LLaVA-OneVision-2は、約800万の再キャプション済み動画サンプルと400万サンプルの空間コーパスで学習された。[1]
JumpScoreは、高頻度で密に反復する動きに焦点を当てた時間的ローカライゼーションのベンチマークである。[1]
LLaVA-OneVision-2-8Bは、標準ベンチマークでQwen3-VL-8Bをビデオタスクで+4.3、空間タスクで+5.3、トラッキングタスクで+15.6上回った。[1]

本紙の見方

今回の発表は、視覚言語モデル(VLM)における動画理解の性能向上を、トークン化の方法論から再考した点で新規性がある。従来のVLMは、動画を均等にサンプリングしたフレームをトークン化するのが一般的だったが、LLaVA-OneVision-2は圧縮動画のビットコストを利用して、情報量の多い部分にトークンを集中させる。これは、動画の冗長性を減らし、長尺動画でも安定した圧縮を実現する試みであり、既存の固定グループ方式の限界を克服するものとみられる。 本紙の過去報道との接続は、関連記事が提供されていないため直接的な言及は避けるが、LLaVAシリーズの進化として、視覚エンコーダの改良からトークン化戦略の革新へと焦点が移っている点は注目に値する。 業界構造への含意としては、動画理解の効率化が進むことで、エッジデバイスでのリアルタイム処理や、大規模な動画データを扱うアプリケーション(監視、自動運転、ロボティクスなど)への応用が期待される。特に、トークン予算を動的に配分する手法は、計算資源の制約がある環境でのVLM展開を後押しする可能性がある。また、JumpScoreのような新しいベンチマークは、評価指標の多様化を促し、モデル開発の方向性に影響を与えるだろう。 未確定の論点としては、codec-streamトークン化の実装詳細(具体的なコーデックやビットコストの計算方法)や、他のモデルとの比較における公平性(トークン予算の一致など)が挙げられる。また、8Bモデル以外のスケールでの性能や、実世界のタスクでの汎化性能も今後の検証が必要である。

なぜ重要か

LLaVA-OneVision-2の登場は、動画理解におけるトークン効率の重要性を示し、VLMの設計思想に一石を投じる。圧縮動画を直接利用する手法は、計算コストの削減と性能向上を両立させる可能性があり、今後のVLM開発の方向性に影響を与えるとみられる。また、新ベンチマークJumpScoreは、これまで評価が難しかった高頻度動作の理解を促進し、ロボティクスやスポーツ解析などの分野での進展に寄与するだろう。