日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
セキュリティ/攻撃arXiv:2608.19737v1

TempJail: 字幕スケジューリングによる大規模視覚言語モデルへの時間的ジェイルブレイク攻撃

TempJail: Temporal Jailbreak Attack against Large Vision-Language Models via Subtitle Scheduling

シェア:XThreadsFacebookLINEはてブBluesky

動画内の字幕の表示タイミングを最適化することで、大規模視覚言語モデルに有害な応答を引き起こすブラックボックス攻撃手法を提案した。

詳しい要約

1. どんなもの?

TempJailは、大規模視覚言語モデル(LVLM)のビデオ理解における時間的脆弱性を悪用する、ブラックボックス型のビデオベースの脱獄攻撃フレームワークである。字幕を攻撃媒体として用い、クエリに整合した対話形式の字幕シーケンスを構築し、その時間的スケジューリング(表示時間とタイムスロット割り当て)を最適化することで、LVLMに有害な意図を満たす応答を引き出す。

2. 先行研究と比べてどこがすごい?

既存のビデオ脱獄手法は、ビデオに埋め込まれたテキスト内容の操作に焦点を当てており、情報の時間的提示(持続時間やタイムスロット割り当て)を考慮していない。TempJailは、脱獄の有効性がテキストの意味論だけでなく、その時間的提示にも依存することを明らかにし、時間的スケジューリングを最適化する点で新規性がある。

3. 技術・手法の肝は?

TempJailは、字幕を攻撃媒体として使用し、クエリに整合した対話形式の字幕シーケンスを構築する。次に、字幕の時間的スケジューリング(各字幕の表示時間とタイムスロット割り当て)を最適化する。この最適化はブラックボックス設定で行われ、LVLMの時間的脆弱性を突く。具体的な最適化手法は要旨からは不明だが、時間的提示を制御することで攻撃成功率を高める。

4. どうやって有効だと検証した?

4つの代表的なLVLMと2つのデータセットを用いた広範な実験を実施し、攻撃成功率(ASR)を評価した。その結果、TempJailはすべてのモデル・データセット設定で最高のASRを達成し、GPT-5とGemini 3.5-Flashでデータセット平均ASRが最強のベースラインをそれぞれ53パーセントポイントと18パーセントポイント上回った。

5. 議論はある?

要旨からは、議論の詳細は不明である。ただし、時間的提示が脱獄効果に影響するという発見は、LVLMの時間的推論の脆弱性を示唆しており、防御策の開発に重要な示唆を与える可能性がある。また、字幕が自然な攻撃媒体であるという点は、実世界のビデオへの適用可能性を示すが、倫理的な懸念も考えられる。

6. 次に読むべき論文は?

要旨で参照されている研究は明示されていないが、関連する分野として、テキストベースの脱獄攻撃、画像ベースの脱獄攻撃、ビデオ理解のためのLVLMの研究が挙げられる。具体的には、既存のビデオ脱獄手法や、LVLMの時間的推論に関する研究が関連する。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Ling Zhou, Yihao Huang, Jingling Sun, Zhiwen Tian, Yi Zeng, Qihe Liu, Shijie Zhou

分類: cs.CV, cs.AI, cs.CL

原文アブストラクト

Large vision-language models (LVLMs) have achieved remarkable progress in video understanding and reasoning. Despite extensive studies on text- and image-based jailbreaks, video jailbreaks against LVLMs remain largely unexplored. Existing video jailbreak methods mainly manipulate textual content embedded in videos, while overlooking how such information is organized over time. Our analysis reveals that jailbreak effectiveness depends not only on the semantics of textual information but also on its temporal presentation, including duration and timing-slot allocation. Motivated by this finding, we use subtitles, which are common in real-world videos and allow semantic content to be presented under precise temporal control without appearing visually intrusive, as a natural attack medium. Based on this insight, we propose TempJail, a black-box video-based jailbreak framework that constructs query-aligned dialogue-style subtitle sequences and optimizes their temporal scheduling to exploit temporal vulnerabilities in LVLMs and elicit responses that satisfy the harmful intent of the source query. Extensive experiments on four representative LVLMs and two datasets demonstrate that TempJail achieves the highest attack success rate across all evaluated model--dataset settings, outperforming the strongest baseline by 53 and 18 percentage points in dataset-averaged ASR on GPT-5 and Gemini 3.5-Flash, respectively.