何が起きたか

HuixiAIは2026年6月5日、エッジSoC「Huixi R1」と共同設計したVLAモデル「RhinoVLA」の技術報告書を公開した。同モデルは、エッジハードウェア上でのリアルタイム展開を目的とし、11.69Hzのエンドツーエンド推論を達成、10Hzの実時間閉ループ制御目標を満たすとしている。

詳細

RhinoVLAは、VLMの視覚・コンテキストトークンを展開遅延の主要因と特定し、トークン効率的なQwen3-VLバックボーンと連続アクションエキスパートを採用することで、VLM側のトークンと計算負荷を削減しつつ、事前学習済みのマルチモーダル能力を維持する。また、異種ロボットの観測とアクションスキーマを統一ポリシーで整列させるため、View Registry、72次元の物理状態・アクションスロット空間、ロボットインスタンスLoRAを組み合わせた統一インターフェースを導入する。展開面では、ハードウェア認識コンパイル、混合精度実行、並列視覚エンコーディングにより最適化される。実験では、同規模のπ0.5と同等の下流性能を達成しつつ、Huixi R1上で11.69Hzの推論を実現した。プロジェクトはGitHubでオープンソース化される予定。

Key Facts

HuixiAIは、エッジSoC「Huixi R1」と共同設計したVLAモデル「RhinoVLA」の技術報告書を公開した(2026年6月5日、arXiv)。[1]
RhinoVLAは、トークン効率的なQwen3-VLバックボーンと連続アクションエキスパートを採用し、VLM側のトークンと計算負荷を削減する。[1]
RhinoVLAは、View Registry、72次元の物理状態・アクションスロット空間、ロボットインスタンスLoRAを組み合わせた統一インターフェースを導入する。[1]
RhinoVLAは、Huixi R1上で11.69Hzのエンドツーエンド推論を達成し、10Hzの実時間閉ループ制御目標を満たす。[1]
実験では、RhinoVLAは同規模のπ0.5と同等の下流性能を達成したとされる。[1]

なぜ重要か

エッジデバイス上での実時間VLA推論は、ロボットの自律性と応答性を高める鍵となる。RhinoVLAの成果は、モデルとチップの共同設計が有効であることを示し、今後のロボットAI開発の方向性に影響を与える可能性がある。