何が起きたか
HuixiAIは2026年6月5日、エッジSoC「Huixi R1」と共同設計したVLAモデル「RhinoVLA」の技術報告書を公開した。同モデルは、エッジハードウェア上でのリアルタイム展開を目的とし、11.69Hzのエンドツーエンド推論を達成、10Hzの実時間閉ループ制御目標を満たすとしている。
詳細
RhinoVLAは、VLMの視覚・コンテキストトークンを展開遅延の主要因と特定し、トークン効率的なQwen3-VLバックボーンと連続アクションエキスパートを採用することで、VLM側のトークンと計算負荷を削減しつつ、事前学習済みのマルチモーダル能力を維持する。また、異種ロボットの観測とアクションスキーマを統一ポリシーで整列させるため、View Registry、72次元の物理状態・アクションスロット空間、ロボットインスタンスLoRAを組み合わせた統一インターフェースを導入する。展開面では、ハードウェア認識コンパイル、混合精度実行、並列視覚エンコーディングにより最適化される。実験では、同規模のπ0.5と同等の下流性能を達成しつつ、Huixi R1上で11.69Hzの推論を実現した。プロジェクトはGitHubでオープンソース化される予定。
Key Facts
| HuixiAIは、エッジSoC「Huixi R1」と共同設計したVLAモデル「RhinoVLA」の技術報告書を公開した(2026年6月5日、arXiv)。 | 出典一覧 |
| RhinoVLAは、トークン効率的なQwen3-VLバックボーンと連続アクションエキスパートを採用し、VLM側のトークンと計算負荷を削減する。 | 出典一覧 |
| RhinoVLAは、View Registry、72次元の物理状態・アクションスロット空間、ロボットインスタンスLoRAを組み合わせた統一インターフェースを導入する。 | 出典一覧 |
| RhinoVLAは、Huixi R1上で11.69Hzのエンドツーエンド推論を達成し、10Hzの実時間閉ループ制御目標を満たす。 | 出典一覧 |
| 実験では、RhinoVLAは同規模のπ0.5と同等の下流性能を達成したとされる。 | 出典一覧 |
本紙の見方
今回の発表は、VLAモデルのエッジ展開という課題に対し、ハードウェアとモデルの共同設計で臨む点が新しい。従来のVLA研究は性能追求が中心で、実時間推論はクラウドや高性能GPUを前提とすることが多かった。RhinoVLAは、トークン削減とハードウェア最適化を組み合わせることで、エッジSoC上で10Hzの制御周期を実現した点で、実用化への一歩と位置づけられる。 本紙の過去報道との接続はないが、業界構造への含意として、エッジAIチップとモデルの協調設計が進むことで、ロボットのオンボード推論が現実味を帯びる。特に、統一インターフェースによるクロスロボット学習は、データ収集の効率化につながり、ロボット基盤モデルの普及を後押しする可能性がある。 一方、未確定の論点として、11.69Hzの推論が実際のロボット制御でどの程度の安定性を示すか、また、π0.5との性能比較が特定のタスクに限定されていないかが挙げられる。さらに、オープンソース化の時期やライセンス、Huixi R1の入手性も今後の普及を左右する。
なぜ重要か
エッジデバイス上での実時間VLA推論は、ロボットの自律性と応答性を高める鍵となる。RhinoVLAの成果は、モデルとチップの共同設計が有効であることを示し、今後のロボットAI開発の方向性に影響を与える可能性がある。