何が起きたか

研究チームは2026年6月14日、自動運転と都市ナビゲーション向けの世界行動モデル(WAM)「Metis」を発表した。Metisは動画生成と行動予測を分離するMixture-of-Transformersアーキテクチャを採用し、推論時に動画生成をバイパスすることで効率性を向上させる。NAVSIMのnavhardおよびnavtestベンチマークとCityWalkerナビゲーションベンチマークで最先端の性能を達成したとしている。

詳細

Metisは、Vision-Language-Actionモデルや動画生成モデルに基づく既存のWAMの限界に対処するため、動画生成と行動予測を分離するエンドツーエンドのフレームワークである。Mixture-of-Transformersアーキテクチャにより、動画生成と行動予測に専用のエキスパートを割り当て、各タスクの分布特性を保持する。非対称アテンションマスクを導入し、両エキスパートの同時学習を可能にしつつ、推論時には行動モデルが動画生成をバイパスできるようにする。これにより、学習と推論の一貫性を保ちながら計算コストを削減する。実験では、NAVSIMのnavhardおよびnavtestベンチマークとCityWalkerナビゲーションベンチマークで最先端の性能を達成し、実ロボット展開でも実用性を確認したとしている。

Key Facts

Metisは、動画生成と行動予測を分離するエンドツーエンドのWAMフレームワークである。[1]
MetisはMixture-of-Transformersアーキテクチャを採用し、動画生成と行動予測に専用のエキスパートを割り当てる。[1]
非対称アテンションマスクにより、推論時に行動モデルが動画生成をバイパスできる。[1]
NAVSIMのnavhardおよびnavtestベンチマークとCityWalkerナビゲーションベンチマークで最先端の性能を達成したとしている。[1]
実ロボット展開により実用性を確認したとしている。[1]

本紙の見方

今回のMetisの発表は、自動運転向け世界行動モデル(WAM)の分野において、推論時の計算効率と一般化性能の両立を目指す新たなアプローチを示すものだ。既存のWAMは、Vision-Language-Actionモデルや動画生成モデルに基づくものが多く、推論時に将来の観測を予測するためレイテンシが高く、また動画と行動のモデリングが密結合であるため表現のミスマッチが生じ、一般化が損なわれるという課題があった。Metisはこれらの課題に対し、動画生成と行動予測を分離し、推論時に動画生成をバイパスすることで、計算コストを削減しつつ性能を維持する設計を採用している。 本紙の過去報道との接続は、関連記事が提供されていないため直接の言及は避けるが、自動運転技術の進展という文脈では、シミュレーションと実環境のギャップを埋める取り組みの一環と位置づけられる。Metisの特徴は、学習時には動画生成と行動予測を同時に学習しつつ、推論時には行動予測のみを行うという非対称な設計にある。これは、学習と推論の一貫性を保ちながら効率を高める手法であり、実用化に向けた重要なステップとみられる。 業界構造への含意としては、自動運転システムの開発において、大規模な動画生成を伴うモデルは計算資源の消費が大きく、車載環境でのリアルタイム推論が課題となっていた。Metisのように推論時に動画生成を省略できるアーキテクチャは、エッジデバイスでの展開を容易にし、自動運転の実用化を後押しする可能性がある。また、動画生成と行動予測を分離することで、それぞれのタスクに特化した最適化が可能となり、モデルの一般化性能の向上につながる。 未確定の論点としては、Metisの性能が実環境でどの程度発揮されるか、特に複雑な都市環境でのナビゲーションにおける堅牢性が焦点になる。また、NAVSIMやCityWalkerのベンチマークでの評価はシミュレーション環境に基づくものであり、実ロボット展開の詳細な条件や結果が公開されていないため、実用性の検証が今後の課題となる。さらに、Metisのアーキテクチャが他のタスクやデータセットにどの程度一般化するかも確認が必要だ。

なぜ重要か

Metisは、自動運転における世界行動モデルの効率性と一般化の課題に取り組むものであり、推論時の計算コスト削減は実用化に向けた重要な進展である。この技術が確立されれば、自動運転システムのリアルタイム性が向上し、より複雑な環境でのナビゲーションが可能になる可能性がある。