日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VLAarXiv:2610.02898

MixVLA: 非不変情報の適応的混合による汎化可能な視覚-言語-行動モデル

MixVLA: Adaptive Mixing of Non-Invariant Information for Generalizable Vision-Language-Action Models

シェア:XThreadsFacebookLINEはてブBluesky

VLAモデルの汎化性能を高めるため、環境固有の非不変表現を確率的に混合して正則化する学習フレームワークを提案し、OOD条件下でのロバスト性を向上させた。

詳しい要約

1. どんなもの?

- Vision-Language-Action (VLA) モデルのゼロショット汎化を改善する訓練フレームワーク MixVLA を提案。 - モデル非依存で、追加の OOD データやアーキテクチャ変更を必要としない。 - 中核は Adaptive Mixing of Non-Invariant Information (AMI) で、非不変表現を確率的に混合し正則化する。 - 混合した非不変特徴を不変表現と融合して行動予測を行い、ロバスト性と表現力を両立。

2. 先行研究と比べてどこがすごい?

- 従来の VLA モデルはタスク関連の不変構造と環境固有の非不変要因が絡み合い、見かけの手がかりに依存しがち。 - MixVLA は追加の OOD データやアーキテクチャ変更なしに汎化を改善する点が新しい。 - 非不変情報を適応的に混合する AMI により、分布固有の変動を正則化しつつ予測的手がかりを保持。 - ポリシーの表現力を犠牲にせずロバスト性を向上させる。

3. 技術・手法の肝は?

- Adaptive Mixing of Non-Invariant Information (AMI) が中核。 - 非不変表現を確率的に混合し、分布固有の変動を正則化。 - 混合された非不変特徴を不変表現と融合して最終的な行動予測に用いる。 - モデル非依存の訓練フレームワークで、追加データやアーキテクチャ変更を要しない。

4. どうやって有効だと検証した?

- LIBERO、LIBERO-Plus、RoboTwin perturbation suite、実世界タスクを含む多様な操作設定で実験。 - MixVLA が全体的なゼロショットロバスト性を改善しつつ、ドメイン内性能も維持することを示した。 - 詳細な評価指標や比較手法は要旨からは不明。

5. 議論はある?

- 要旨からは不明。 - 限界や失敗事例、計算コスト、ハイパーパラメータ感度などについての議論は記述されていない。

6. 次に読むべき論文は?

- 要旨で参照/比較されている研究は明示されていない。 - 関連手法として Vision-Language-Action (VLA) モデル、LIBERO、LIBERO-Plus、RoboTwin perturbation suite が挙げられる。 - 同分野の定番として RT-1、RT-2、OpenVLA などが考えられるが、要旨に記載はない。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Pingrui Zhang, Yu Zhang, Pengyuan Wu, Bin Wang, Haoming Song, Xianqiang Gao, ZhaxiZhuoma, Zhigang Wang, Dong Wang, Bin Zhao, Xuelong Li

分類: cs.RO

原文アブストラクト

Vision-Language-Action (VLA) models have achieved remarkable advances in robotic manipulation, yet their zero-shot generalization under out-of-distribution (OOD) conditions remains limited. These models often entangle task-relevant invariant structure with environment-specific non-invariant factors, causing policies to rely on spurious appearance cues during action prediction. In this work, we propose \textbf{MixVLA}, a model-agnostic training framework that improves the generalization of VLA models without requiring additional OOD data or architectural modifications. The key component of MixVLA is \textbf{Adaptive Mixing of Non-Invariant Information (AMI)}. AMI stochastically mixes non-invariant representations to regularize distribution-specific variability while preserving complementary predictive cues. The mixed non-invariant features are then fused with invariant representations for final action prediction, resulting in improved robustness without sacrificing policy expressiveness. Extensive experiments across challenging manipulation settings, including LIBERO, LIBERO-Plus, the RoboTwin perturbation suite, and real-world tasks, demonstrate that MixVLA improves overall zero-shot robustness while retaining strong in-domain performance.

関連論文

PR本紙発行元 EmplifAI