何が起きたか
2023年3月31日にarXivに公開された論文『Where are we in the search for an Artificial Visual Cortex for Embodied Intelligence?』において、研究チームはエンボディドAIのための事前学習済み視覚表現(PVR)に関する大規模な実証研究を発表した。彼らは17のタスク(移動、ナビゲーション、器用操作、モバイル操作)からなるCortexBenchを構築し、既存のPVRを体系的に評価した。その結果、既存のPVRはどれも普遍的に優れているわけではないことが判明した。さらに、7つの異なるソースからの4,000時間以上のエゴセントリックビデオ(430万枚以上の画像)とImageNetを組み合わせ、マスクオートエンコーディング(MAE)を用いて異なるサイズのビジョントランスフォーマーを訓練した。最大モデルであるVC-1は、平均ではすべての既存PVRを上回ったが、普遍的に支配するわけでもなかった。
詳細
研究チームは、事前学習データの規模と多様性の影響を調べるため、データのスライスを用いてMAEでビジョントランスフォーマーを訓練した。その結果、データセットの規模と多様性を拡大しても性能が普遍的に向上するわけではなく、平均的には向上することが分かった。これは先行研究の推論に反するものである。 さらに、VC-1をタスク固有またはドメイン固有に適応させると大幅な改善が見られ、適応後のVC-1はCortexBenchのすべてのベンチマークで既知の最良結果と同等かそれ以上の性能を達成した。また、実世界のハードウェア実験では、VC-1と適応版VC-1が既存の最強PVRを上回った。 この論文は新しい技術を提案するものではなく、厳密な体系的評価と、PVRに関する幅広い知見(一部は先行研究の狭い領域での知見を否定するもの)を提供し、研究コミュニティのためにコードとモデルをオープンソース化している。モデルの訓練には10,000 GPU時間以上を要した。
Key Facts
| 論文は2023年3月31日にarXivで公開された。 | [1] |
| CortexBenchは17のタスク(移動、ナビゲーション、器用操作、モバイル操作)で構成される。 | [1] |
| 既存のPVRはどれも普遍的に優れているわけではない。 | [1] |
| 7つの異なるソースからの4,000時間以上のエゴセントリックビデオ(430万枚以上の画像)とImageNetを組み合わせた。 | [1] |
| マスクオートエンコーディング(MAE)を用いて異なるサイズのビジョントランスフォーマーを訓練した。 | [1] |
| データセットの規模と多様性を拡大しても性能が普遍的に向上するわけではなく、平均的には向上する。 | [1] |
| 最大モデルVC-1は平均ではすべての既存PVRを上回ったが、普遍的に支配するわけではない。 | [1] |
| VC-1を適応させると、CortexBenchのすべてのベンチマークで既知の最良結果と同等かそれ以上の性能を達成した。 | [1] |
| 実世界のハードウェア実験で、VC-1と適応版VC-1は既存の最強PVRを上回った。 | [1] |
| モデルの訓練には10,000 GPU時間以上を要した。 | [1] |
なぜ重要か
この研究は、エンボディドAIにおける視覚基盤モデルの評価方法を確立し、事前学習データの規模と多様性の影響について重要な知見を提供する。VC-1のオープンソース化は、今後の研究のベースラインとして広く利用される可能性がある。