何が起きたか
2026年6月5日、arXivにプレプリント『Robotic Policy Adaptation via Weight-Space Meta-Learning』が公開された。提案手法WIZARDは、凍結したVision-Language-Action (VLA)モデルに対し、タスク固有のLoRAパラメータを単一のフォワードパスで生成する。実機としてFranka Emika Pandaが用いられ、シミュレーションを超えたタスク特化の適応が確認された。
詳細
WIZARDは、メタ学習によりタスクの証拠(言語指示とデモ動画)から専門家のLoRA更新を直接マッピングする。ターゲットタスクのアクションラベルやテスト時最適化を必要としない。実験ではLIBEROベンチマークで、未見のデータセットコレクションで最大約2倍、未見タスクで最大約14倍の性能向上を達成した。実機のFranka Emika Pandaでは、実領域適応ベースラインを一貫して上回った。
Key Facts
| WIZARDは、言語指示と短いデモ動画からタスク固有のLoRAパラメータを単一フォワードパスで生成する。 | [1] |
| LIBERO実験で、未見データセットコレクションで最大約2倍、未見タスクで最大約14倍の性能向上。 | [1] |
| Franka Emika Panda実機で、実領域適応ベースラインを一貫して上回った。 | [1] |
| ターゲットタスクのアクションラベルやテスト時最適化を必要としない。 | [1] |
なぜ重要か
VLAモデルの適応をファインチューニングなしで実現するWIZARDは、ロボットのタスク追加コストを大幅に削減する可能性がある。これにより、ロボットの柔軟な展開が進み、製造業や物流などでの実用化が加速するだろう。ただし、実環境での汎用性とメタ学習のデータ要件が実用化の鍵を握る。