何が起きたか

2025年12月12日、arXivに投稿された論文で、視覚言語モデル(VLM)と視覚言語行動モデル(VLA)のクロスドメイン汎用性を測定する統一ベンチマーク「MultiNet v1.0」が発表された。GPT-5、Pi0、Magmaを評価し、全モデルが未知のドメインやモダリティで性能低下を示した。

詳細

MultiNet v1.0は、視覚的グラウンディング、空間推論、ツール使用、物理常識、マルチエージェント協調、連続ロボット制御の6つの能力領域を対象とする。評価の結果、全モデルでモダリティの不整合、出力形式の不安定性、ドメイン転移時の知識の壊滅的劣化が観察された。コード、データ、リーダーボードは公開されている。

Key Facts

MultiNet v1.0は、VLMとVLAのクロスドメイン汎用性を測定する統一ベンチマークである。[1]
評価対象はGPT-5、Pi0、Magmaの3モデル。[1]
6つの能力領域:視覚的グラウンディング、空間推論、ツール使用、物理常識、マルチエージェント協調、連続ロボット制御。[1]
全モデルが未知のドメイン、馴染みのないモダリティ、クロスドメインタスクシフトで大幅な性能低下を示した。[1]
コード、データ、リーダーボードは公開されている。[1]

なぜ重要か

このベンチマークは、フィジカルAIの進捗を測る共通の物差しを提供する。現行モデルの限界を可視化することで、今後の研究開発の優先順位に影響を与える可能性がある。