何が起きたか
arXivに2025年10月7日付で掲載された論文(識別番号2510.05681v2)において、研究チームはVLAのテスト時スケーリング手法「Masking Distribution Guided Selection (MG-Select)」を提案した。この手法は、追加の学習や外部モジュールを必要とせず、モデル内部の特性を利用して複数の候補から最適な行動を選択する。具体的には、参照アクショントークン分布からのKLダイバージェンスを信頼度指標として用いる。
詳細
VLAはロボット制御で顕著な性能を示す一方、単一推論パラダイムのため高精度を要するタスクでは根本的に限界がある。外部検証器を用いたテスト時スケーリング手法は有望だが、追加学習が必要で、未見の条件への一般化に失敗する。MG-Selectは、同じVLAで状態と言語条件をランダムにマスクした入力を用いて生成した参照分布を導入し、行動の不確実性を提供しつつ、対象タスクの分布に整合させる。さらに、状態と言語条件にドロップアウトを適用して条件付き分布と無条件分布の両方を学習する共同訓練戦略を提案し、参照分布の品質を向上させる。実験では、タスク関連条件のマスキングによる行動選択の信頼性を実証し、多様なシミュレーションと実世界のベンチマークでベースモデルを一貫して改善したと報告している。
Key Facts
| 論文はarXivに2025年10月7日付で掲載された(識別番号2510.05681v2)。 | [1] |
| 提案手法は「Masking Distribution Guided Selection (MG-Select)」と呼ばれる。 | [1] |
| MG-Selectは追加の学習や外部モジュールを必要としない。 | [1] |
| MG-Selectは参照アクショントークン分布からのKLダイバージェンスを信頼度指標として使用する。 | [1] |
| 参照分布は同じVLAで状態と言語条件をランダムにマスクした入力を用いて生成される。 | [1] |
| 共同訓練戦略では、状態と言語条件にドロップアウトを適用して条件付き分布と無条件分布の両方を学習する。 | [1] |
| 実験では、タスク関連条件のマスキングによる行動選択の信頼性を実証した。 | [1] |
| MG-Selectは多様なシミュレーションと実世界のベンチマークでベースモデルを一貫して改善したと報告されている。 | [1] |
なぜ重要か
この研究は、VLAの高精度タスクにおける限界を、追加学習や外部検証器なしで克服する可能性を示す。テスト時スケーリングの新たなアプローチとして、ロボット制御の性能向上に寄与することが期待される。