何が起きたか

研究チームは2025年11月19日、物理推論ベンチマーク「G2U」と、物理中心の行動コード「PhysCode」を用いたAIエージェント「IPR-1」を発表した。IPR-1は1000以上のゲームで事前学習し、総合性能でGPT-5を上回ったと報告している。

詳細

IPR-1は、世界モデルのロールアウトを用いてVLMのポリシーをスコアリングし強化する手法を採用する。PhysCodeは、意味的意図とダイナミクスを整合させる物理中心の行動コードで、予測と推論のための共有行動空間を提供する。G2Uベンチマークは1000以上の異種ゲームで構成され、視覚的なドメインギャップが大きい。既存のVLMや世界モデルは、物理と因果の把握に苦戦する一方、IPR-1は原始的な直感から目標駆動の推論まで堅牢に動作し、未見のゲームへのゼロショット転移も達成した。

Key Facts

研究チームは、物理推論ベンチマーク「G2U」と、物理中心の行動コード「PhysCode」を用いたAIエージェント「IPR-1」を発表した。[1]
IPR-1は1000以上のゲームで事前学習し、総合性能でGPT-5を上回ったと報告している。[1]
IPR-1は、世界モデルのロールアウトを用いてVLMのポリシーをスコアリングし強化する手法を採用する。[1]
G2Uベンチマークは1000以上の異種ゲームで構成され、視覚的なドメインギャップが大きい。[1]
IPR-1は未見のゲームへのゼロショット転移を達成した。[1]

本紙の見方

今回の発表は、物理推論におけるAIの新たなアプローチを示すものだ。従来のVLMや世界モデルが視覚的な詳細に過適合し、物理や因果の核心メカニズムを捉えられないという問題に対し、IPR-1は物理中心の相互作用を重視する。世界モデルのロールアウトでVLMのポリシーを強化する手法は、強化学習と世界モデルの利点を組み合わせたものとみられる。 本紙の過去報道との接続では、[本紙の関連記事]が存在しないため、直接の連続性を論じることはできない。しかし、物理推論の分野では、これまでにも世界モデルやVLMを用いた研究が進められてきた。例えば、OpenAIのGPT-5は汎用推論で高い性能を示すが、インタラクティブな環境での物理推論には課題があるとされる。IPR-1は、そのような既存モデルの限界を補う可能性がある。 業界構造への含意として、物理推論はロボティクスや自動運転など、実世界での意思決定に重要だ。IPR-1の手法は、シミュレーション環境での学習を実世界に転移する際の橋渡しになる可能性がある。特に、物理中心の行動コード「PhysCode」は、予測と推論の共有行動空間を提供することで、モデルの解釈性や汎化性を高める効果が期待される。 一方で、未確定の論点も多い。まず、IPR-1の性能が実際の物理環境でどの程度発揮されるかは不明だ。ゲーム環境と実世界では物理法則やセンサー情報が異なるため、ゼロショット転移の実用性は検証が必要である。次に、GPT-5との比較はベンチマーク上の話であり、実タスクでの優位性は確認されていない。最後に、学習データや計算資源の規模が公開されていないため、再現性やスケーラビリティの評価が難しい。 今後確認すべき点として、第一に、IPR-1の実世界の物理環境での性能評価が挙げられる。第二に、学習に使用したゲームの種類や数、計算資源の詳細が公開されるかどうか。第三に、PhysCodeの設計が他のタスクやドメインにどの程度適用可能か、という点だ。

なぜ重要か

物理推論は、AIが実世界で安全かつ効果的に動作するための基盤となる。IPR-1の手法は、シミュレーションと実世界のギャップを埋める可能性があり、ロボティクスや自動運転などの分野に影響を与えるとみられる。また、GPT-5を上回る性能は、物理推論における専用モデルの優位性を示唆しており、今後のAI開発の方向性に一石を投じる。