何が起きたか

研究チームは2025年6月10日、マルチモーダル行動モデルの評価と適応のためのオープンソースツールキットおよびベンチマークスイート「MultiNet」を発表した。MultiNetは、視覚・言語・行動の各領域にわたるモデルを厳密に評価・適応するための完全オープンソースのベンチマークとソフトウェアエコシステムであり、1.3兆トークン以上の複合データセットを提供する。

詳細

MultiNetは、視覚言語モデル(VLM)と視覚言語行動モデル(VLA)の評価のための標準化されたプロトコルを確立し、関連データ、モデル、評価をダウンロードするためのオープンソースソフトウェアを提供する。複合データセットには、画像キャプション、視覚質問応答、常識推論、ロボット制御、デジタルゲームプレイ、シミュレーション locomotion/manipulation などが含まれ、1.3兆トークン以上に及ぶ。

Key Facts

研究チームは、マルチモーダル行動モデルの評価と適応のためのオープンソースツールキットおよびベンチマークスイート「MultiNet」を発表した。[1]
MultiNetは、視覚・言語・行動の各領域にわたるモデルを評価・適応するための完全オープンソースのベンチマークとソフトウェアエコシステムである。[1]
MultiNetは、VLMとVLAの評価のための標準化された評価プロトコルを確立する。[1]
MultiNetは、1.3兆トークン以上の複合データセットを提供する。[1]
複合データセットには、画像キャプション、視覚質問応答、常識推論、ロボット制御、デジタルゲームプレイ、シミュレーション locomotion/manipulation などが含まれる。[1]

なぜ重要か

MultiNetの登場は、マルチモーダル行動モデルの研究開発における評価基盤を標準化し、コミュニティ全体の進展を加速させる可能性がある。これにより、ロボット制御やデジタルエージェントなど、実世界での応用に向けたモデルの信頼性評価が進むことが期待される。