何が起きたか

2025年12月12日、arXivに投稿された論文で、視覚言語モデル(VLM)と視覚言語行動モデル(VLA)のクロスドメイン汎用性を測定する統一ベンチマーク「MultiNet v1.0」が発表された。GPT-5、Pi0、Magmaを評価し、全モデルが未知のドメインやモダリティで性能低下を示した。

詳細

MultiNet v1.0は、視覚的グラウンディング、空間推論、ツール使用、物理常識、マルチエージェント協調、連続ロボット制御の6つの能力領域を対象とする。評価の結果、全モデルでモダリティの不整合、出力形式の不安定性、ドメイン転移時の知識の壊滅的劣化が観察された。コード、データ、リーダーボードは公開されている。

Key Facts

MultiNet v1.0は、VLMとVLAのクロスドメイン汎用性を測定する統一ベンチマークである。出典一覧
評価対象はGPT-5、Pi0、Magmaの3モデル。出典一覧
6つの能力領域:視覚的グラウンディング、空間推論、ツール使用、物理常識、マルチエージェント協調、連続ロボット制御。出典一覧
全モデルが未知のドメイン、馴染みのないモダリティ、クロスドメインタスクシフトで大幅な性能低下を示した。出典一覧
コード、データ、リーダーボードは公開されている。出典一覧

本紙の見方

本ベンチマークの新規性は、従来の断片的な評価を統合し、VLM/VLAの汎用性を横断的に測定する点にある。特に、ロボット制御を含む6領域を統一した枠組みで評価する試みは、フィジカルAIの進展を測る上で重要な基盤となる。一方で、評価対象がGPT-5、Pi0、Magmaの3モデルに限られており、現行の主要モデルを網羅しているとは言い難い。また、ベンチマーク自体が新しく、その妥当性や再現性は今後の検証が待たれる。業界への含意として、この結果は汎用エージェントの実現がまだ遠いことを示唆するが、同時に評価手法の標準化が進むことで、モデル開発の焦点が明確になる可能性がある。未確定の論点としては、各モデルの性能低下が具体的にどのタスクで顕著だったか、またベンチマークの結果が実世界のロボット応用にどの程度外挿できるかが挙げられる。

なぜ重要か

このベンチマークは、フィジカルAIの進捗を測る共通の物差しを提供する。現行モデルの限界を可視化することで、今後の研究開発の優先順位に影響を与える可能性がある。