何が起きたか

iFLYTEKは2026年6月24日、技術報告書をarXivで公開し、統合型マルチモーダル基盤モデル「iFLYTEK-Embodied-Omni」を発表した。本モデルは、視覚(ビデオ・画像)、言語、行動を単一のOmniフレームワーク内で統合的にモデル化する。

詳細

iFLYTEK-Embodied-Omniは、視覚言語モデル(VLM)、ビデオ生成モデル(VGM)、行動生成モデル(AGM)の3つのコンポーネントで構成され、共有のマルチモーダル自己注意機構を通じて通信する。設計は脳と小脳の協調に例えられ、VLMとVGMが高次の脳として指示理解、タスク計画、進捗追跡、将来の視覚状態予測を担い、AGMが低次の小脳として計画されたサブゴールと共有マルチモーダル文脈を実行可能な行動チャンクに変換する。学習には、人間のデモンストレーションとロボットインタラクションからの行動注釈付きおよび行動注釈なしの身体化ビデオを、身体化推論、身体化知覚、汎用画像テキストデータと組み合わせて包括的なデータセットを構築する。さらに、VLM、VGM、AGMを段階的に訓練し、その後完全なモデルを共同で微調整する4段階戦略を採用する。

Key Facts

iFLYTEKは2026年6月24日に技術報告書をarXivで公開し、統合型マルチモーダル基盤モデル「iFLYTEK-Embodied-Omni」を発表した。[1]
本モデルは視覚(ビデオ・画像)、言語、行動を単一のOmniフレームワーク内で統合的にモデル化する。[1]
アーキテクチャは脳と小脳の協調に例えられ、VLMとVGMが高次の脳、AGMが低次の小脳として機能する。[1]
学習には行動注釈付きおよび行動注釈なしの身体化ビデオを、身体化推論、身体化知覚、汎用画像テキストデータと組み合わせて使用する。[1]
4段階戦略でVLM、VGM、AGMを段階的に訓練し、その後完全なモデルを共同で微調整する。[1]

本紙の見方

今回の発表は、身体化AI(embodied AI)分野における基盤モデルの設計思想に一石を投じるものだ。従来のアプローチは、視覚言語推論、ビデオベースの世界モデリング、行動生成をそれぞれ専門化したモデルを個別に開発し、それらをカスケード接続する方式が一般的だった。しかし、そのようなパイプラインは、将来の観測を合成してから行動を推論するため、インターフェースのボトルネックや予測誤差の複合化が課題とされてきた。iFLYTEK-Embodied-Omniは、これらを単一のフレームワークに統合し、共有のマルチモーダル自己注意機構で通信させることで、この問題を回避しようとしている。 本紙の過去報道との接続は、関連記事が提供されていないため直接の言及はできないが、身体化AIの分野では、近年、大規模言語モデルをロボット制御に応用する研究が活発化している。その中で、本モデルは「脳と小脳の協調」という生物学的なメタファーを採用し、高次の認知機能と低次の運動制御を分離する点が特徴的だ。これは、単にモデルを大規模化するだけでなく、機能分化による効率性と拡張性を追求する動きの一環とみられる。 業界構造への含意としては、まず競合他社への影響が考えられる。iFLYTEKは音声認識で知られる中国企業だが、身体化AIの基盤モデルに参入することで、ロボット制御や自動運転などへの応用を視野に入れている可能性がある。また、学習データの構築方法として、人間のデモンストレーションとロボットインタラクションを組み合わせる点は、データ収集の標準化に寄与するかもしれない。さらに、4段階の学習戦略は、計算資源の効率的な利用を可能にし、モデル開発のコスト削減につながる可能性がある。 未確定の論点としては、まずモデルの具体的な性能評価が挙げられる。技術報告書ではアーキテクチャと学習戦略が述べられているが、ベンチマーク結果や実ロボットでの検証結果は明らかにされていない。また、行動生成モデルが出力する行動チャンクの粒度や、長期のタスク実行における安定性も不明だ。さらに、学習データの規模や構成、モデルのパラメータ数などの詳細も公開されていないため、他モデルとの比較は難しい。今後、追加の実験結果やオープンソース化が進むかどうかが焦点になる。

なぜ重要か

本モデルは、身体化AIにおける統合アプローチの新たな選択肢を示すものであり、今後の基盤モデル開発の方向性に影響を与える可能性がある。特に、脳と小脳の分離という設計は、効率的な学習と推論を実現するための一つの解として注目に値する。読者にとっては、身体化AIの技術動向を把握する上で重要なマイルストーンとなる。