何が起きたか

Tencentは2026年4月8日、実世界のエージェント向け基盤モデル「HY-Embodied-0.5」を発表した。同モデルは、エッジ展開向けの2B活性化パラメータモデルと、複雑な推論向けの32B活性化パラメータモデルの2種類で構成される。

詳細

HY-Embodied-0.5は、一般的なVision-Language Models (VLMs)とエンボディッドエージェントの要求のギャップを埋めるために設計された。空間・時間的視覚知覚と、予測・相互作用・計画のための高度なエンボディッド推論を強化する。アーキテクチャにはMixture-of-Transformers (MoT)を採用し、モダリティ固有の計算を可能にし、潜在トークンにより知覚表現を向上させる。推論能力向上のため、反復的な自己進化型ポストトレーニング手法を導入し、大規模モデルの能力を小規模モデルに転移するオン・ポリシー蒸留を用いる。22のベンチマークで評価され、MoT-2Bモデルは同規模の最先端モデルを16ベンチマークで上回り、32BバリアントはGemini 3.0 Proなどのフロンティアモデルに匹敵する性能を達成したとされる。下流のロボット制御実験では、VLAモデルの訓練に活用され、実世界の物理評価で有望な結果を得た。コードとモデルはGitHubで公開されている。

Key Facts

Tencentは、実世界のエージェント向け基盤モデル「HY-Embodied-0.5」を発表した。[1]
HY-Embodied-0.5は、エッジ展開向けの2B活性化パラメータモデルと、複雑な推論向けの32B活性化パラメータモデルの2種類で構成される。[1]
アーキテクチャにはMixture-of-Transformers (MoT)を採用し、モダリティ固有の計算を可能にする。[1]
22のベンチマークで評価され、MoT-2Bモデルは同規模の最先端モデルを16ベンチマークで上回り、32BバリアントはGemini 3.0 Proなどのフロンティアモデルに匹敵する性能を達成したとされる。[1]
コードとモデルはGitHubで公開されている。[1]

本紙の見方

今回の発表は、TencentがエンボディッドAI分野に本格参入したことを示す。同社はこれまで大規模言語モデルやクラウドサービスで知られるが、実世界のエージェント向け基盤モデルの公開は、ヒューマノイドロボットや自律エージェントの開発競争が激化する中での戦略的な布石とみられる。 本紙の過去報道では、広東省にヒューマノイドロボット関連企業が1.6万社超存在し、モルガン・スタンレーの調査で世界の影響力のある企業100社のうち11社が選出されたことを報じた。Tencentは広東省深圳に本社を置く企業であり、今回のモデル公開は、同省のエコシステムの中で基盤モデルを提供するプレイヤーとしての位置づけを強める可能性がある。 業界構造への含意として、HY-Embodied-0.5はエッジ展開向けの2Bモデルを提供することで、ロボットメーカーがクラウドに依存せずに推論を行える選択肢を増やす。これは、ロボットの応答速度やプライバシー、オフライン運用の要件に応えるものであり、サプライチェーンにおけるAIモデルの選定基準に影響を与える可能性がある。また、オープンソースでの公開は、競合他社との差別化を図りつつ、開発者コミュニティの獲得を狙ったものとみられる。 未確定の論点としては、実際のロボット制御実験の詳細や、2Bモデルのエッジデバイスでの実運用時の性能、32Bモデルの商用利用条件などが挙げられる。また、同モデルが広東省のロボット企業に採用されるかどうかも、今後の動向を左右する要素となる。

なぜ重要か

TencentがエンボディッドAI向け基盤モデルを公開したことで、中国の大手テック企業がヒューマノイドロボットの「頭脳」分野に参入する流れが明確になった。これは、ロボット開発のコスト構造や技術競争に影響を与え、今後の産業地図を変える可能性がある。