何が起きたか

研究チームは2026年2月9日、arXivにプレプリント「Self-Supervised Bootstrapping of Action-Predictive Embodied Reasoning」を公開した。提案手法R&B-EnCoReは、VLAモデルの身体化推論を自己教師ありで改善し、操作・ナビゲーション・自動運転の各タスクで性能向上を確認した。

詳細

R&B-EnCoReは、推論を重要度重み付き変分推論内の潜在変数として扱い、モデル自身が身体化固有の推論訓練データセットを生成・蒸留する。外部報酬、検証器、人手の注釈を必要としない。検証は、Franka Panda(シミュレーション)とWidowX(ハードウェア)での操作、二足・車輪・自転車・四足の脚式ナビゲーション、自動運転の各身体化で実施。VLAアーキテクチャは1B、4B、7B、30Bパラメータのものを使用した。結果、全プリミティブを無差別に推論するモデルと比較し、操作成功率28%向上、ナビゲーションスコア101%改善、衝突率指標21%低減を達成した。

Key Facts

R&B-EnCoReは、外部報酬・検証器・人手の注釈なしに、自己教師ありで身体化推論の訓練データセットを生成・蒸留する。出典一覧
操作(Franka Pandaシミュレーション、WidowXハードウェア)、脚式ナビゲーション(二足、車輪、自転車、四足)、自動運転の各身体化で検証。出典一覧
VLAアーキテクチャは1B、4B、7B、30Bパラメータのものを使用。出典一覧
全プリミティブを無差別に推論するモデルと比較し、操作成功率28%向上、ナビゲーションスコア101%改善、衝突率指標21%低減。出典一覧

本紙の見方

本手法の新規性は、身体化推論の訓練データを人手のテンプレートや注釈に頼らず、モデル自身の自己教師あり蒸留で生成する点にある。従来のCoT推論は、シーン内の物体や高次プランなどのプリミティブをテンプレートで指定するため、行動予測に無関係な情報を処理させられる問題があった。R&B-EnCoReは推論を潜在変数として扱い、重要度重み付き変分推論により行動予測に寄与する推論を蒸留する。これにより、外部報酬や人手の注釈を不要にしつつ、インターネット規模の知識を身体化実行に接地できる。 本紙の過去報道との接続はないが、VLAモデルの発展において、推論の質とポリシーの質の相互依存(良いポリシーなしに推論を検証できず、良い推論なしに堅牢なポリシーを構築できない)を解消する試みとして位置づけられる。業界構造への含意としては、ロボットの操作・ナビゲーション・自動運転など、身体化AIの学習コストを低減し、データ収集や注釈のボトルネックを緩和する可能性がある。特に、人手の注釈に依存しないため、スケールしやすい点が重要だ。 未確定の論点としては、実機での検証がWidowXのみであり、他のハードウェアでの汎用性が不明な点、また、提案手法が生成する推論の質をどう評価するかが挙げられる。さらに、30Bパラメータのモデルでの性能が報告されているが、計算コストや実用性については言及されていない。

なぜ重要か

R&B-EnCoReは、身体化AIの学習における人手依存を減らし、自己教師ありで推論を改善する道を示す。これにより、ロボットや自動運転の開発サイクルが加速し、より堅牢な行動決定が可能になる可能性がある。