日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VLAarXiv:2609.03142

どのモダリティが重要かを感知する:ロバストなVLAポリシーのための証拠ゲート正則化

Sensing Which Modality Matters: Evidence-Gated Regularization for Robust VLA Policies

シェア:XThreadsFacebookLINEはてブBluesky

VLAポリシーが複数センサー入力の融合時に生じる「モダリティ絡み合い」問題を解決するため、センサーごとのタスク関連性に基づいて正則化を適応的に適用するEvidence-Gated Regularization (EGR)を提案した。シミュレーションと実ロボットで成功率を大幅に向上させた。

詳しい要約

1. どんなもの?

本論文は、Vision-Language-Action (VLA) ポリシーにおけるモダリティ間のスプリアスな相関に起因する失敗(modality entanglement)に対処するため、Evidence-Gated Regularization (EGR) を提案する。EGRは、フレームごと・センサーごとのタスク関連性の指標(evidence)に基づき、低evidenceセンサーには不変性(invariance)を、高evidenceセンサーには単一センサー充足性(single-sensor sufficiency)を課す2つの整合性目的をゲートする。推論時のオーバーヘッドはゼロである。BEHAVIOR-1Kに基づくベンチマークと、2つの実ロボットセットアップ(バイマニュアル、触覚)で検証し、シミュレーションおよび実機での成功率を向上させる。

2. 先行研究と比べてどこがすごい?

先行研究では、VLAポリシーが限られた均質なデモデータから学習する際に、タスク関連信号ではなくセンサー間のスプリアスな相関に依存してしまう問題(modality entanglement)が明示されていなかった。EGRは、モダリティに依存しない訓練目的を導入し、推論時のオーバーヘッドなしで、センサーの重要度に応じて正則化を適応的に適用する点が新しい。また、実ロボットの異なるエンボディメント(バイマニュアル、触覚)で有効性を示している点も先行研究と比べて進んでいる。

3. 技術・手法の肝は?

EGRは、各フレーム・各センサーについてタスク関連性の指標(evidence)を計算し、その値に基づいて2つの整合性目的をゲートする。低evidenceセンサーには、そのセンサーを無視しても出力が変わらないようにする不変性(invariance)を課し、高evidenceセンサーには、そのセンサー単独でも出力が維持されるようにする単一センサー充足性(single-sensor sufficiency)を課す。これにより、モダリティ間のスプリアスな相関を減らし、センサーが欠落・劣化した場合のロバスト性を高める。

4. どうやって有効だと検証した?

BEHAVIOR-1Kに基づくベンチマーク(推論のみの診断スイートと47のロールアウトベースのスキル)と、2つの実ロボットセットアップ(2台のKinovaアームと3台のRGBカメラによるバイマニュアル、および視覚とGelSight触覚センサーを組み合わせた単腕MELFA ASSISTA)で検証した。シミュレーションでは、全モダリティで成功率が12.5%から16.4%(+31%)、無情報センサー劣化で9.4%から16.5%(+75%)、単一センサーへのフォールバックで2.8%から6.1%(+120%)に向上。実機では、物理的物体によるディストラクタ下で、バイマニュアルで30%から85%(+183%)、触覚セットアップで55%から70%(+27%)に向上した。

5. 議論はある?

要旨からは、EGRの限界や潜在的な欠点についての議論は不明である。ただし、提案手法がモダリティの重要度を動的に評価することに依存しており、evidenceの推定が不正確な場合には正則化が適切に機能しない可能性が考えられる。また、ベンチマークはBEHAVIOR-1Kに基づいており、他のタスクや環境への一般化については要旨からは不明である。

6. 次に読むべき論文は?

要旨で参照されている関連研究として、BEHAVIOR-1Kベンチマーク、VLAポリシー、およびモダリティ融合に関する研究が挙げられる。具体的には、Vision-Language-Actionモデル(例:RT-2、Octo)や、ロバストなマルチモーダル学習のための正則化手法(例:クロスモーダル整合性)に関する論文が関連する。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Yue Yang, Diego Romeres, Chiori Hori, Gedas Bertasius, Daniel Szafir, Siddarth Jain

分類: cs.RO, cs.CV, cs.LG

原文アブストラクト

Vision-Language-Action (VLA) policies fuse multimodal sensory inputs, but training on limited and homogeneous robot demonstrations encourages spurious inter-sensor correlations rather than task-relevant signal, a failure we term modality entanglement. Under real-world occlusions and distractors, this manifests as nuisance sensitivity to corruption of uninformative sensors and single-modality insufficiency when only one informative sensor remains intact. We propose Evidence-Gated Regularization (EGR), a modality-agnostic training objective that introduces zero inference-time overhead. EGR derives a per-frame and per-sensor task-relevance signal to gate two state-conditional consistency objectives: invariance on low-evidence sensors, and single-sensor sufficiency on high-evidence ones. We introduce a benchmark based on BEHAVIOR-1K, comprising a fast inference-only diagnostic suite and 47 rollout-based skills targeting modality entanglement. We validate EGR on this benchmark and on two real-robot setups with fundamentally different embodiments: a bi-manual setup with two Kinova arms and three RGB cameras, and a single-arm MELFA ASSISTA setup combining vision and GelSight tactile sensors. EGR improves simulation success rates (SR) from 12.5% to 16.4% under full modalities (+31%), from 9.4% to 16.5% under uninformative-sensor corruption (+75%), and from 2.8% to 6.1% under single-sensor fallback (+120%). Under physical-object distractors, EGR boosts SR from 30% to 85% on the bi-manual setup (+183%) and from 55% to 70% on the tactile setup (+27%).

関連論文