何が起きたか
arXivは2026-09-08、論文「CAST: Alternating State-Value Targets and Expanded Policy Gradients for Model-Based Reinforcement Learning」を公開した。論文は、学習済みモデルとオンライン計画を組み合わせるモデルベース強化学習において、方策ではなく状態価値を、プランナー誘導行動と現在の方策を交互に用いて学習する手法CASTを提案している。 評価はDeepMind ControlとHumanoidBench Suitesで行われ、物理機体のUnitree Go2 quadrupedでdynamic handstandへの転移成功も示した。
詳細
CASTは、action-value criticの代わりにstate-value criticを用い、その学習ターゲットに「実際のプランナー誘導遷移」と「現在の方策下の想像遷移」を組み合わせる設計である。論文は、この交互過程により、より強いプランナー行動の利点を使いつつ、学習中の方策で正則化できるとしている。 論文が示した実験対象はDeepMind ControlとHumanoidBench Suitesで、実機転移の対象はUnitree Go2 quadrupedである。実機での課題はdynamic handstandであり、論文はこれへの転移成功を報告している。
Key Facts
| CASTは、state-value criticを用い、プランナー誘導遷移と現在の方策下の想像遷移を組み合わせたターゲットで学習する手法である | [1] |
| 論文は2026-09-08にarXivで公開された | [1] |
| 評価先はDeepMind ControlとHumanoidBench Suitesである | [1] |
| 物理機体としてUnitree Go2 quadrupedへの転移成功を示した | [1] |
| 実機課題はdynamic handstandである | [1] |
本紙の見方
CASTの新規性は、モデルベース強化学習でオンライン計画を使う際に、方策の価値ではなく状態価値を、プランナー誘導行動と現行方策の両方で更新する点にある。従来の「学習した方策を評価する」設計から一歩進め、より強い計画結果を価値学習に取り込もうとしている。ただし、これは新しいロボット製品や制御基盤の発表ではなく、あくまで学習アルゴリズムの提案である。 本紙の関連記事である leaderobot.comがロボットのサービス化を論じる記事を掲載 は、車とロボットの技術的な共通点と所有からサービス利用への移行を論じていた。これに対しCASTは、実機のUnitree Go2にダイナミック・ハンドスタンドを移した点で、サービス化の議論ではなく、制御性能を実世界へ持ち込む学習経路を示したところに意味がある。つまり、知能側の改善が実機動作へ接続できるかが焦点であり、製品化の主語はUnitreeではなく論文の制御手法である。 業界構造でみると、論文はシミュレーション評価だけでなく、DeepMind ControlやHumanoidBenchを経てUnitree Go2へ転移しているため、入力の世界モデル、計画、価値学習、実機制御の連結が主題である。ここで効くのはハードの供給網や量産能力ではなく、シミュレーションから実機へ落とすための学習設計と評価系である。とはいえ、転移成功が1機種・1課題に限られる以上、次に確認すべきは他課題への一般化、別機体への再現性、そしてプランナー誘導と現行方策の交互学習がどこまで安定するかである。
なぜ重要か
この論文は、モデルベース強化学習の成果を実機のUnitree Go2に接続した点で、シミュレーション評価にとどまらないことを示している。研究開発の現場にとっては、学習した制御方策が物理機体の動作に移るかどうかが重要であり、その橋渡しにプランナー誘導と状態価値学習を組み合わせた設計が使える可能性がある。
日本への影響
日本企業や研究機関にとっては、ロボット本体の量産よりも、シミュレーション、オンライン計画、実機転移をつなぐ学習系の再現性が論点になる。特に、Unitree Go2のような既存機体で実機転移を示す研究は、ハードの差ではなく制御学習の差が競争力になりうることを示している。