何が起きたか
2026年7月15日にarxiv.orgで公開された論文において、Hy-Embodied-RxBrain(以下RxBrain)と名付けられた具現化認知基盤モデルが発表された。RxBrainは言語と視覚の想像力を統合し、タスク分解や制約、時間的順序などの抽象的な計画構造を言語で、世界状態予測やサブゴール計画を視覚で表現する。実験では、実ロボットの連続動作生成において有望な性能を示したと報告されている。
詳細
RxBrainは、言語、画像、ビデオの理解と生成を単一のモデルでサポートする統一マルチモーダルMixture-of-Transformersアーキテクチャを採用している。訓練には、具現化ビデオをテキストと視覚の計画監督に変換する自動パイプラインを使用する。評価用にRxBrain-Benchを導入し、モデルがテキストと視覚の統合を通じて具現化プランを表現できるかを検証する。実験では、RxBrainは具現化の理解と生成能力を維持しつつ、テキスト推論、世界状態予測、サブゴール計画を結合したプランを生成する。さらに、大規模な行動データの事前学習なしで実ロボットの連続動作生成に拡張され、有望な性能を示したとしている。
Key Facts
| RxBrainは、言語と視覚の想像力を統合し、単一の計画シーケンスで具現化プランを表現する具現化認知基盤モデルである。 | [1] |
| RxBrainは、言語、画像、ビデオの理解と生成をサポートする統一マルチモーダルMixture-of-Transformersアーキテクチャを採用している。 | [1] |
| 訓練には、具現化ビデオをテキストと視覚の計画監督に変換する自動パイプラインを使用する。 | [1] |
| 評価用にRxBrain-Benchを導入し、モデルがテキストと視覚の統合を通じて具現化プランを表現できるかを検証する。 | [1] |
| RxBrainは、大規模な行動データの事前学習なしで実ロボットの連続動作生成に拡張され、有望な性能を示したとしている。 | [1] |
本紙の見方
今回のRxBrainの発表は、具現化認知の分野において、言語と視覚の統合を単一のモデルで実現する点で新規性がある。従来の視覚言語モデルはシーン理解とテキストによる意思決定に重点を置き、生成的世界モデルは将来の視覚状態の予測に重点を置いていた。RxBrainはこれらを統合し、言語が計画の抽象構造を提供し、視覚が世界状態予測とサブゴール計画を通じてその構造を具体化するという点で、既存のアプローチとは一線を画す。 本紙の過去報道との接続は、関連記事が提供されていないため直接的な言及はできないが、具現化AIの分野では、ロボットの行動生成における基盤モデルの活用が進んでおり、RxBrainはその流れに沿ったものと位置づけられる。特に、大規模な行動データの事前学習なしで実ロボットの動作生成に拡張できる点は、データ収集のコスト削減につながる可能性があり、業界構造に影響を与える可能性がある。 業界構造への含意としては、ロボットの行動生成における基盤モデルの競争が激化する中で、RxBrainのような統合アーキテクチャが標準となる可能性がある。また、自動パイプラインによる訓練データの生成は、データの質と量の確保に課題を持つ企業にとって有用な手法となるかもしれない。 未確定の論点としては、RxBrainの実ロボットでの性能が具体的にどの程度なのか、また、大規模な行動データを事前学習したモデルと比較してどの程度の性能差があるのかが焦点となる。さらに、RxBrain-Benchの評価基準が業界標準となるかどうかも注目される。
なぜ重要か
RxBrainは、言語と視覚の統合による具現化認知の新たなアプローチを示しており、ロボットの行動生成における基盤モデルの発展に影響を与える可能性がある。特に、大規模な行動データを必要としない点は、実用化へのハードルを下げる可能性があり、ロボット産業全体にとって重要な意味を持つ。