何が起きたか

研究チームは、複合AIモデル向けの汎用サーバーシステム「M*」を発表した。M*はモデルをデータフローグラフとして表現し、リクエストをグラフ上の走査として処理する。評価では、vLLM-Omniと比較してテキストから画像へのワークロードで平均20%の遅延削減を達成した。

詳細

M*は、視覚エンコーダ、言語バックボーン、拡散・フローヘッド、オーディオコーデック、アクションジェネレータ、ワールドモデル予測器など、多様なコンポーネントを統合する複合モデルアーキテクチャに対応する。既存のサーバーフレームワークはモデル構造に関する狭い仮定に基づいており、この多様性に対応できないとしている。M*は「Walk Graph」と呼ばれるモジュール式抽象化を導入し、モデルコンポーネントの任意の構成、物理クラスタへの柔軟な配置、分散ランタイム内でのモデル非依存の最適化を可能にする。評価では、BAGEL上のテキストから画像へのワークロードでvLLM-Omniと比較して平均20%のエンドツーエンド遅延削減、Qwen3-Omni上のテキストから音声へのワークロードでリアルタイム係数を最大2.9倍、スループットを最大2.7倍向上、ロボット計画ではV-JEPA 2-ACロールアウトベースラインと比較して最大12.5倍の性能向上を達成した。

Key Facts

M*は複合AIモデル向けの汎用サーバーシステムであり、モデルをデータフローグラフとして表現する。[1]
M*は「Walk Graph」というモジュール式抽象化を導入し、モデルコンポーネントの任意の構成、物理クラスタへの柔軟な配置、モデル非依存の最適化を可能にする。[1]
M*はBAGEL上のテキストから画像へのワークロードでvLLM-Omniと比較して平均20%のエンドツーエンド遅延削減を達成した。[1]
M*はQwen3-Omni上のテキストから音声へのワークロードでリアルタイム係数を最大2.9倍、スループットを最大2.7倍向上させた。[1]
M*はロボット計画においてV-JEPA 2-ACロールアウトベースラインと比較して最大12.5倍の性能向上を達成した。[1]

なぜ重要か

複合AIモデルの効率的な配信は、マルチモーダルAIの実用化に不可欠な要素であり、M*の提案はその基盤技術として重要である。特に、ロボット計画や音声対話など、リアルタイム性が求められる分野での性能向上は、物理AIの進展を後押しする可能性がある。