何が起きたか

研究チームは2026年6月18日、オープンワールド環境で動作するロボット向けの汎用具身知能モデル「Vesta」を発表した。Vestaは、位置推定・空間推論・ナビゲーション・長期計画を単一の基盤モデルに統合し、専門モデルを組み合わせた従来のマルチモデル構成に代わる手法を提案する。ベンチマーク評価では、個別のSOTAモデルを平均20%以上、カテゴリ別最良モデルのアンサンブルを10%以上上回り、実世界のロボットタスクでは成功率を35%以上改善した。

詳細

Vestaは、空間接地を誘発するように設計された多様で大規模なキュレーション済みコーパスと、長時間の時間軸にわたる推論を可能にする単純なマルチモーダルメモリハーネスを組み合わせる。これにより、位置推定、空間推論、ナビゲーション、長期計画の各機能を単一の基盤モデルに統合する。評価では、多様なベンチマークで個別のSOTAモデルを平均20%以上、カテゴリ別最良モデルのアンサンブルを10%以上上回り、実世界のロボットタスクでは成功率を35%以上改善した。

Key Facts

Vestaは、位置推定・空間推論・ナビゲーション・長期計画を単一の基盤モデルに統合する汎用具身知能モデルである。[1]
Vestaは、多様なベンチマークで個別のSOTAモデルを平均20%以上、カテゴリ別最良モデルのアンサンブルを10%以上上回った。[1]
実世界のロボットタスクでは、Vestaはタスク成功率を35%以上改善した。[1]
Vestaは、空間接地を誘発する多様で大規模なキュレーション済みコーパスと、長時間の時間軸にわたる推論を可能にするマルチモーダルメモリハーネスを組み合わせる。[1]

本紙の見方

今回の発表の新規性は、ロボットのオープンワールド運用に必要な複数の能力を単一の基盤モデルに統合した点にある。従来は位置推定、空間推論、ナビゲーション、長期計画をそれぞれ専門のモデルで担い、それらを組み合わせるマルチモデル構成が一般的だった。Vestaはこれを単一モデルに集約し、計算コストの削減とカスケードエラーの回避を図る。ベンチマークで専門モデル群を上回ったことは、汎用モデルが専門モデルに劣らないという主張を裏付けるもので、ロボットAIの設計思想に一石を投じる。 業界構造への含意として、Vestaのアプローチはロボットのソフトウェアスタックを簡素化する可能性がある。マルチモデル構成では、各モデルの連携に伴うエラー伝播や計算資源の増大が課題だったが、単一モデル化によりこれらの問題が軽減される。これは、ロボットのリアルタイム処理やエッジデバイスへの実装を容易にし、ロボットの導入コストを下げる方向に働く。また、大規模なキュレーション済みコーパスとメモリハーネスの設計は、実世界データの活用と長期推論の両立を目指すもので、今後のロボット学習のデータ戦略にも影響を与える。 一方で、未確定の論点も残る。Vestaの実世界でのタスク成功率の改善は35%以上とされるが、具体的なタスクの種類や環境の詳細は公開されていない。また、単一モデル化による計算コストの削減効果が具体的にどの程度かは示されていない。さらに、Vestaがどのようなハードウェアで動作するのか、実用化に向けたスケーラビリティは不明である。今後は、Vestaのモデル規模や学習データの詳細、実ロボットへの実装例が公表されるかが焦点になる。

なぜ重要か

Vestaの登場は、ロボットAIの開発において、専門モデルの組み合わせから単一の汎用モデルへの転換が現実的な選択肢であることを示す。これにより、ロボットのソフトウェアスタックが簡素化され、導入コストの低減やリアルタイム処理の向上が期待される。また、実世界での成功率向上は、ロボットの実用化を後押しする可能性がある。