何が起きたか
2025年12月12日、arXivに投稿された論文で、視覚言語モデル(VLM)と視覚言語行動モデル(VLA)のクロスドメイン汎用性を測定する統一ベンチマーク「MultiNet v1.0」が発表された。GPT-5、Pi0、Magmaを評価し、全モデルが未知のドメインやモダリティで性能低下を示した。
詳細
MultiNet v1.0は、視覚的グラウンディング、空間推論、ツール使用、物理常識、マルチエージェント協調、連続ロボット制御の6つの能力領域を対象とする。評価の結果、全モデルでモダリティの不整合、出力形式の不安定性、ドメイン転移時の知識の壊滅的劣化が観察された。コード、データ、リーダーボードは公開されている。
Key Facts
| MultiNet v1.0は、VLMとVLAのクロスドメイン汎用性を測定する統一ベンチマークである。 | [1] |
| 評価対象はGPT-5、Pi0、Magmaの3モデル。 | [1] |
| 6つの能力領域:視覚的グラウンディング、空間推論、ツール使用、物理常識、マルチエージェント協調、連続ロボット制御。 | [1] |
| 全モデルが未知のドメイン、馴染みのないモダリティ、クロスドメインタスクシフトで大幅な性能低下を示した。 | [1] |
| コード、データ、リーダーボードは公開されている。 | [1] |
なぜ重要か
このベンチマークは、フィジカルAIの進捗を測る共通の物差しを提供する。現行モデルの限界を可視化することで、今後の研究開発の優先順位に影響を与える可能性がある。