何が起きたか

Hy-Embodied-VLM-1.0は、物理世界エージェント向けの基盤モデルとして発表された。同モデルは38ベンチマーク中19で同規模最良を達成し、前世代のHy-Embodied-0.5 MoT-2Bと比較して平均性能を8.4%向上させた。

詳細

Hy-Embodied-VLM-1.0は、Hy3-A3B言語バックボーンとHy-ViT2ビジョンエンコーダを基盤とし、効率的なMixture-of-Expertsアーキテクチャを採用している。アクション中心の能力分類法に基づき、事前学習と事後学習のデータパイプラインを構築した。評価では、身体化知覚、物理世界理解、身体化推論を含む38ベンチマークで、同規模モデル中最良を19件達成し、Qwen3.6-A3BやCosmos 3を上回った。

Key Facts

Hy-Embodied-VLM-1.0は、38ベンチマーク中19で同規模最良を達成した。[1]
前世代のHy-Embodied-0.5 MoT-2Bと比較して平均性能を8.4%向上させた。[1]
3B活性パラメータで、前世代の32B活性パラメータモデルに近い性能を実現した。[1]
Hy3-A3B言語バックボーンとHy-ViT2ビジョンエンコーダを基盤としている。[1]
Qwen3.6-A3BやCosmos 3を大幅に上回る性能を示した。[1]

本紙の見方

今回の発表は、物理世界エージェント向け基盤モデルの効率性と性能の両立を追求する流れの一環と位置づけられる。Hy-Embodied-VLM-1.0は、3Bの活性パラメータで前世代の32B活性モデルに匹敵する性能を達成しており、これはエッジ展開やリアルタイム応答が求められるロボティクス分野において重要な進展である。同モデルは、アクション中心の能力分類法に基づくデータパイプラインを採用し、事前学習段階からエージェント能力を育成する点が特徴的だ。 本紙の過去報道では、物理世界エージェント向けの基盤モデル開発が加速していることを報じてきた。例えば、2026年5月の「物理世界エージェント向け基盤モデル、競争激化」では、各社がマルチモーダル理解と行動生成を統合するモデルを競って開発していると指摘した。また、2026年6月の「エッジAI向け軽量モデル、性能と効率のトレードオフ」では、軽量化と性能維持の難しさを論じた。今回のHy-Embodied-VLM-1.0は、これらの流れを踏まえ、効率的なMoEアーキテクチャによってトレードオフを克服した点で、既定路線の延長線上にあると同時に、具体的な成果を示したと言える。 業界構造への含意として、同モデルの登場は、物理世界エージェント分野における競争をさらに激化させるとみられる。特に、Qwen3.6-A3BやCosmos 3といった競合モデルと比較して優位性を示したことで、モデル開発の主戦場が単なる性能向上から、効率性と性能の両立に移行しつつあることを示唆する。また、3B活性パラメータでの高性能は、ロボットのオンボード推論やクラウド依存の低減につながり、サプライチェーンやデータ収集の在り方にも影響を与える可能性がある。 一方で、未確定の論点も残る。第一に、同モデルの実環境でのロバスト性や安全性がどの程度確保されているかは、公開情報では確認できない。第二に、38ベンチマークのうち19で最良を達成したが、残りのベンチマークでの性能差や、特定タスクでの弱点が明らかではない。第三に、同モデルの学習データの構成や、実運用時の推論コストがどの程度になるかは、今後の詳細な評価を待つ必要がある。今後は、実機での検証結果や、他社モデルとの直接比較、さらにはエッジデバイスでの実装事例が確認されることが焦点になる。

なぜ重要か

このモデルの登場は、物理世界エージェントの実用化に向けた効率性の重要性を示すものであり、ロボティクスや自動運転など、リアルタイム応答が求められる分野での展開を後押しする可能性がある。また、軽量モデルでの高性能は、コスト削減や省電力化につながり、業界全体の技術ロードマップに影響を与えるとみられる。