何が起きたか

2026年7月27日、arXivにプレプリント『The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation』(識別番号2607.24720v1)が公開された。この論文は、基盤モデルエージェントのマルチターン長期計画能力の向上を目的とし、制御可能なマルチターン環境を導入して、事前学習、GRPOおよびOPDによる事後学習、MOPDによる統合の3段階で能力の獲得・形成・統合を研究している。

詳細

論文は、既存モデルが制御不能で不透明なインターネットデータで訓練されるため、計画能力がどのように獲得・形成・統合されるかを特定することが難しいと指摘する。これに対し、統一された制御可能なマルチターン環境を導入し、長期計画を体系的に研究する。 事前学習段階では、データ形式・分布・品質を研究し、CoT状態遷移モデリングによる明示的な世界モデル構築が長期汎化を強化すること、原子スキルだけでは合成的汎化に不十分で少量の長期データが有効であること、準最適な軌跡は誤差が長期にわたって増幅するため性能を著しく損なうことを示す。 事後学習段階では、相互情報量を用いて一般的な計画パターンとタスク固有の計画知識を区別する。計画パターンについて、事後学習の不要・有効・非対応の3つの適用領域を特定し、OPDは低品質・長期設定でGRPOよりも一貫した更新方向を提供するため有効領域が広いとする。計画知識については、異なる知識を持つ教師から未見の手順を蒸留すると、学生の事前の世界モデルを損なう可能性があると述べる。 統合段階では、マルチ教師オン方策蒸留(MOPD)が環境間で共有される計画パターンに収束することで能力を統合することを示す。互換性のあるパターンは環境間汎化を可能にし、部分的に共有されたパターンは継続学習を支援するが、完全に矛盾するパターンは深刻な干渉を引き起こす。

Key Facts

論文は2026年7月27日にarXivで公開された(識別番号2607.24720v1)。[1]
論文タイトルは『The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation』。[1]
研究は、制御可能なマルチターン環境を導入し、事前学習・事後学習・統合の3段階で長期計画を研究する。[1]
事前学習では、CoT状態遷移モデリングによる明示的な世界モデル構築が長期汎化を強化するとしている。[1]
原子スキルだけでは合成的汎化に不十分で、少量の長期データが有効とされる。[1]
準最適な軌跡は誤差が長期にわたって増幅するため性能を著しく損なうとされる。[1]
事後学習では、GRPOとOPDを比較し、OPDは低品質・長期設定でGRPOよりも有効領域が広いとされる。[1]
計画知識の蒸留では、異なる知識を持つ教師から未見の手順を蒸留すると学生の事前の世界モデルを損なう可能性があるとされる。[1]
MOPDは環境間で共有される計画パターンに収束することで能力を統合する。[1]
互換性のあるパターンは環境間汎化を可能にし、部分的に共有されたパターンは継続学習を支援するが、完全に矛盾するパターンは深刻な干渉を引き起こす。[1]

なぜ重要か

この研究は、基盤モデルエージェントの長期計画能力の向上に寄与する可能性がある。制御可能な環境での分析により、事前学習データの品質や事後学習手法の選択が計画能力に与える影響を体系的に理解できる。