日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VLA/ベンチマーク/安全性arXiv:2608.17600v1

LIBERO-VIFO: 視覚言語行動モデルにおける視覚的手がかり追従の能力と安全性のベンチマーク

LIBERO-VIFO: Benchmarking the Capability and Safety of Visual Cue Following in Vision-Language-Action Models

シェア:XThreadsFacebookLINEはてブBluesky

VLAモデルが視覚的手がかりを正しく追従できるか、また許可されていない手がかりを無視できるかを評価するベンチマークLIBERO-VIFOを提案し、7つのVLAモデルの評価を通じて、言語指示なしでも視覚的手がかりに従ってタスクを実行するリスクを明らかにした。

詳しい要約

1. どんなもの?

LIBERO-VIFOは、Vision-Language-Action (VLA)モデルにおける視覚的手がかり追従の能力と安全性を評価するためのベンチマークである。8つの視覚的手がかりファミリーを定義し、4つのプロトコル(Part I: 手がかり理解と許可された追従、Part II: 言語手がかりとの競合や空の言語条件下での許可されていない視覚的手がかり追従)を通じて、VLAモデルが許可された手がかりに従い、許可されていない手がかりを無視できるかを体系的に評価する。

2. 先行研究と比べてどこがすごい?

既存研究は限られた手がかり形式しか扱わず、最終的なタスク成功率のみに焦点を当てており、手がかり追従能力の粗い評価しか提供していない。また、すべての視覚的手がかりを許可されたものとして扱うため、許可されていない手がかりへの追従による安全性リスクを考慮していない。LIBERO-VIFOは、多様な手がかり形式をカバーし、能力と安全性の両方を評価する点で新しい。

3. 技術・手法の肝は?

LIBERO-VIFOは、8つの視覚的手がかりファミリー(例:色、形状、矢印など)を定義し、Part IとPart IIの2部構成で4つのプロトコルを設計する。Part Iでは手がかり理解と許可された追従をテストし、Part IIでは言語手がかりとの競合や空の言語条件下での許可されていない追従を評価する。これにより、手がかり理解が実行に変換されるか、また言語指示なしで手がかりに従うリスクを検出する。

4. どうやって有効だと検証した?

7つのVLAモデルを評価し、視覚的手がかりの理解が実行に確実に変換されないこと、現在のVLAが言語指示なしで手がかり指示タスクを実行できることを明らかにした。さらに、シーンにインスタンス化された手がかり、安全クリティカルな設定、実ロボット展開での拡張実験により、これらの発見を裏付けた。

5. 議論はある?

要旨からは、視覚的手がかりの理解と実行の乖離、許可されていない手がかり追従のリスクが議論されている。また、視覚中心の安全性をVLAコミュニティの新たな視点として提案している。具体的な議論の詳細は要旨からは不明。

6. 次に読むべき論文は?

要旨で参照されている既存のベンチマークや関連手法は明示されていないが、VLAモデルや視覚的手がかり追従に関する研究が関連する。次に読むべき論文としては、VLAモデルのベンチマーク(例:LIBERO)や視覚的手がかりを用いたロボット学習に関する研究が挙げられる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Zhengyan Qian, Rui Yan, Alex Jinpeng Wang, Jinhui Tang

分類: cs.RO

原文アブストラクト

Visual cues are increasingly adopted to guide robot learning, but whether Vision-Language-Action (VLA) models can reliably follow authorized cues while disregarding unauthorized ones remains unclear. Existing work covers only a narrow range of cue forms and focuses on final task success, providing only a coarse assessment of cue-following capability. Treating all visual cues as authorized also leaves safety risks of unauthorized following unexplored. To address these gaps, we introduce LIBERO-VIFO, a benchmark to evaluate both the capability and safety of visual cue following in VLA models. LIBERO-VIFO defines eight visual cue families spanning diverse forms. A total of four protocols in two parts are defined: Part I tests cue understanding and authorized following, while Part II evaluates unauthorized visual cue following under language-cue conflict and empty language conditions. Evaluating seven VLA models reveals that although visual cue understanding does not reliably translate into execution, current VLAs are able to execute cue-indicated tasks without language instruction, exposing an emerging risk of unauthorized visual cue following. Extended experiments on scene-instantiated cues, safety-critical settings, and real-robot deployment corroborate these findings. LIBERO-VIFO brings both the capability and safety of visual cue following into systematic evaluation, establishing visual-centric safety as a new perspective for the VLA community.