何が起きたか
研究チームは2026年5月17日、arXivにプレプリント「DyGRO-VLA: Cross-Task Scaling of Vision-Language-Action Models via Dynamic Grouped Residual Optimization」を公開した。同フレームワークは、VLAモデルの強化学習(RL)最適化をタスク横断的に拡張し、汎用性を向上させることを目的とする。
詳細
DyGRO-VLAは2段階の最適化フレームワークで、(1)情報理論の原理に基づきタスク横断的な潜在表現を獲得し、(2)混合RL残差(mixture-of-RL-residuals)により方策最適化を動的に洗練する。これにより、タスク関連の潜在情報を活用しつつ、最適化過程での表現への悪影響を軽減する。評価はLIBERO、RoboTwin2ベンチマークと実世界で実施され、マルチタスク訓練と分布シフトの下で強いベースラインを一貫して上回ったと報告されている。
Key Facts
| DyGRO-VLAは、VLAモデルのRL最適化をタスク横断的に拡張する2段階フレームワークである。 | [1] |
| 同フレームワークは、情報理論に基づくタスク横断的潜在表現の獲得と、動的グループ化残差最適化(mixture-of-RL-residuals)を組み合わせる。 | [1] |
| 評価はLIBERO、RoboTwin2ベンチマークおよび実世界で実施され、マルチタスク訓練と分布シフトの下で強いベースラインを一貫して上回ったと報告されている。 | [1] |
なぜ重要か
VLAモデルの汎用性向上は、ロボットが多様なタスクを学習し適応する能力に直結する。DyGRO-VLAは、タスク横断的な最適化手法として、ロボット基盤モデルの発展に寄与する可能性がある。今後の実世界での検証結果が注目される。