何が起きたか

arXivは2026-09-14、PhysBrain 1.5を公開した。8Bモデルで、28のembodied understandingベンチマークの平均スコアは72.5である。論文は、物理環境の理解、行動生成、将来状態予測を1つの学習枠組みに統合したと説明している。

詳細

事前学習では、人間の相互作用動画のみをembodied supervisionの源泉とし、タスク中心のエピソードで意味的・空間的文脈を、復元した動きやその後の観測と対応づけた。続く適応では、監督あり微調整として人間の実演、ロボット軌跡、シミュレーション経験の混合データを使った。 モデルは、言語応答、エンドエフェクタの動き、密な視覚ターゲットを離散系列として符号化し、autoregressive next-token predictionで同時最適化する設計である。論文はさらに、空間的に整列したRGB、depth、robot-mask出力を通じて、エンドエフェクタ軌跡の生成や将来シーン予測が可能だと示している。

Key Facts

PhysBrain 1.5は、物理環境の理解、行動生成、将来状態予測を共通学習枠組みに統合するモデルである。[1]
8Bモデルは、28のembodied understandingベンチマークで平均72.5を記録した。[1]
論文は、オープンソースとして新たな最高水準を達成したとしている。[1]
事前学習は、人間の相互作用動画のみをembodied supervisionの源泉としている。[1]
微調整では、人間の実演、ロボット軌跡、シミュレーション経験を混合している。[1]

本紙の見方

PhysBrain 1.5で新しいのは、物理世界向けの能力を「理解」「行動」「予測」に分けた上で、それらを離散系列と次トークン予測に落とし込んだ点である。既定路線の延長としては、出発点が一般的なvision-language modelであり、追加学習も人間動画、実演、ロボット軌跡、シミュレーションという既存のデータ源を組み合わせる構成である。だが、論文の焦点は単なるマルチモーダル拡張ではなく、物理的な観測・相互作用・環境変化のループを1つの学習問題として扱う点にあると読める。 ただ、今回の発表だけでも、フィジカルAIの性能評価が言語理解中心の尺度から、エンドエフェクタ軌跡や将来シーン予測まで含む評価へ移っていることが分かる。28ベンチマーク平均72.5という数値は、単一タスクの得点よりも、複数のembodied understanding能力を横断して見ている点に意味がある。さらに、RGB、depth、robot-maskを空間整列させて出力する設計は、知覚と行動の接続を明示しており、従来の画像・文章生成モデルとは要求されるデータ構造が異なる。 業界構造への含意としては、学習資源がテキスト中心から、人間動画、ロボット軌跡、シミュレーション経験へ広がっている点が大きい。ここではモデル性能だけでなく、どの種類の実世界データを継続的に集め、どう符号化し、どう評価するかが競争軸になるとみられる。加えて、オープンソースで新たな最高水準をうたう以上、今後は再現可能性と比較条件が焦点になる。特に、8Bという規模での優位が、より大きいモデルや別のベンチマークでも維持されるのか、また行動生成と将来予測が実機制御のどの条件で有効かは、まだ確認が必要である。

なぜ重要か

論文が示すのは、フィジカルAIの基盤モデルが、言語処理だけではなく、行動軌跡と将来状態の予測まで一体で学習する段階に入っていることである。開発側にとっては、どのデータを学習に使い、どのベンチマークで比較するかが性能評価の前提になる。

日本への影響

日本のロボット研究や製造現場で論点になるのは、モデルの一般性能そのものより、ロボット軌跡やシミュレーション経験を含む学習枠組みを、実機データとどう接続するかである。特に、エンドエフェクタ軌跡やdepth、robot-maskのような空間整列出力を使う設計は、視覚・把持・作業計画のデータ整備が必要になることを示している。