何が起きたか
2025年5月8日、arxiv.orgに掲載された論文で、手続き生成されたオープンエンドな行動環境における視覚・言語・行動モデルのベンチマーク「MultiNet v0.2」が発表された。GPT-4o、GPT-4.1、OpenVLA、Pi0 Base、Pi0 FASTなどの最新VLM/VLAモデルをProcgenベンチマークの多様なタスクで評価し、ゼロショット汎化性能を分析した。
詳細
論文は、VLAモデルのゼロショット汎化能力を体系的に評価するため、MultiNet v0.2を導入した。評価対象はGPT-4o、GPT-4.1、OpenVLA、Pi0 Base、Pi0 FASTで、Procgenベンチマークの多様な手続き生成タスクを用いた。分析の結果、(1) 全モデルが分布外タスクへのゼロショット汎化に有意な限界を示し、性能は行動表現やタスク複雑性に強く影響されること、(2) VLAモデルは堅牢なアーキテクチャ設計により他のモデルを概ね上回ること、(3) VLMの変種は適切に制約すると大幅な改善が見られ、プロンプトエンジニアリングへの感度が高いことが明らかになった。ベンチマーク、評価フレームワーク、および結果は公開されている。
Key Facts
| 論文「Benchmarking Vision, Language, & Action Models in Procedurally Generated, Open Ended Action Environments」がarxiv.orgに掲載された(2025年5月8日)。 | [1] |
| MultiNet v0.2は、GPT-4o、GPT-4.1、OpenVLA、Pi0 Base、Pi0 FASTをProcgenベンチマークの多様な手続き生成タスクで評価する。 | [1] |
| 分析により、全評価モデルが分布外タスクへのゼロショット汎化に有意な限界を示し、性能は行動表現とタスク複雑性に影響されることが判明した。 | [1] |
| VLAモデルは堅牢なアーキテクチャ設計により他のモデルを概ね上回った。 | [1] |
| VLMの変種は適切な制約下で大幅な改善を示し、プロンプトエンジニアリングへの感度が高いことが示された。 | [1] |
なぜ重要か
VLAモデルのゼロショット汎化性能を評価する標準的なベンチマークが登場したことで、今後のモデル開発の指針が明確になる。特に、現行モデルの限界を定量的に示した点は、フィジカルAIの実用化に向けた課題を浮き彫りにし、研究投資の方向性に影響を与えるとみられる。