何が起きたか
arxiv.orgに2026年5月21日付で掲載された論文において、言語駆動の物理ベース人型制御のための拡散ポリシー「SCRIPT」が発表された。提案手法は、動作・物理状態・テキストを統合するトランスフォーマーと多段階訓練を特徴とし、評価では従来の最先端手法を上回る結果を示したとしている。
詳細
論文は「SCRIPT: Scalable Diffusion Policy with Multi-stage Training for Language-driven Physics-based Humanoid Control」と題され、arxiv.orgで公開されている。中核となるのはJoint Action-State-Text Diffusion Transformer (JAST-DiT)で、動作・物理状態・テキストを専用のトークンストリームとして表現し、結合アテンションにより言語意味論と制御ダイナミクスの直接的な相互作用を可能にする。また、非線形履歴条件付け機構を導入し、最近の文脈を密に保持しつつ長期履歴から疎な手がかりをサンプリングすることで、自己回帰制御を安定化させる。教師あり模倣事前学習に加え、ハイブリッド報酬を用いた強化学習によるポストトレーニング段階を提案し、閉ループシミュレーション内で動作品質と指示追従を改善する。評価では、テキスト整合性・動作品質・物理的実在性の指標で従来手法を上回り、1200時間のMotionMillionデータセットでのスケーリング研究によりモデル規模の増大に伴う一貫した性能向上が確認された。コードは将来公開予定。
Key Facts
| 論文「SCRIPT: Scalable Diffusion Policy with Multi-stage Training for Language-driven Physics-based Humanoid Control」がarxiv.orgに掲載された(2026年5月21日付)。 | [1] |
| 中核技術はJoint Action-State-Text Diffusion Transformer (JAST-DiT)で、動作・物理状態・テキストを専用トークンストリームとして結合アテンションで処理する。 | [1] |
| 非線形履歴条件付け機構により、最近の文脈を密に保持し長期履歴から疎な手がかりをサンプリングする。 | [1] |
| 教師あり模倣事前学習に加え、ハイブリッド報酬を用いた強化学習によるポストトレーニング段階を提案。 | [1] |
| 1200時間のMotionMillionデータセットでのスケーリング研究により、モデル規模の増大に伴う一貫した性能向上が確認された。 | [1] |
本紙の見方
今回の発表は、言語指示による物理ベース人型制御という研究領域において、拡散ポリシーと多段階訓練を組み合わせた新たな枠組みを提示するものである。既存手法が意味的表現力と物理的実現性の間でトレードオフに直面していたのに対し、SCRIPTはJAST-DiTによる統合表現と、模倣学習から強化学習への段階的移行によって、この両立を図る点に新規性がある。特に、強化学習段階でフローサンプリング過程に学習可能なノイズを注入する手法は、閉ループシミュレーション内での動作品質と指示追従の改善に寄与する設計であり、従来の拡散ポリシーには見られない工夫である。 本紙の過去報道との接続は、関連記事が提供されていないため直接的な言及は避けるが、物理ベース人型制御の分野では、近年の大規模データセットと拡散モデルの進展を背景に、言語条件付けの研究が活発化している。SCRIPTはその流れに位置づけられるが、特にスケーリング研究に焦点を当て、データ量とモデル規模の増加が性能向上に直結することを示した点は、今後の大規模事前学習の方向性を示唆する。 業界構造への含意としては、この手法が実ロボットへの応用を視野に入れた場合、シミュレーションから実機への転移(sim-to-real)が重要な課題となる。論文では閉ループシミュレーションでの評価に留まっており、実機での検証は未確認である。また、コード公開が予定されていることから、研究コミュニティでの再現性とベンチマーク比較が進み、競争が加速する可能性がある。サプライチェーンや価格への直接的な影響は現時点では見込めないが、制御アルゴリズムの進展はロボットの性能向上に寄与し、結果として産業用・サービス用ロボットの導入コスト低減につながる可能性がある。 未確定の論点としては、まず実機での検証結果が挙げられる。シミュレーションでの優位性が実環境でも保たれるかは未知数であり、特に物理的実在性の指標が実機でどのように評価されるかが焦点となる。また、強化学習段階での報酬設計の詳細や、ハイブリッド報酬の重み付けが性能に与える影響も明らかにされていない。さらに、MotionMillionデータセットの特性や、他のデータセットでの汎用性も確認が必要である。加えて、計算コストや推論速度といった実用面での評価も、今後の研究で明らかにされるべき点である。
なぜ重要か
言語指示で人型ロボットを制御する技術は、汎用エージェント実現への重要な一歩であり、SCRIPTはその性能を大幅に向上させる可能性を示した。この成果は、ロボットの応用範囲を拡大し、人間との自然なインタラクションを可能にする基盤となり得る。