日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
行動生成arXiv:2609.07049

大規模離散方策:確率的反復スコアリングによる明示的行動モデリングの進展

Large Discrete Policy: Advancing Explicit Behavior Modeling with Stochastic Iterative Scoring

シェア:XThreadsFacebookLINEはてブBluesky

行動方策を離散的な候補選択としてモデル化し、確率的な反復スコアリングで表現力を高める新しいフレームワークを提案。自動運転やロボット操作で連続生成モデルに匹敵する性能を示した。

詳しい要約

1. どんなもの?

本論文は、行動ポリシーを完全に離散化したフレームワークであるLarge Discrete Policy (LDiP)を提案している。LDiPは、物理的に妥当な候補行動の大規模な語彙から行動を選択する。連続生成モデルのような反復的ノイズ除去ではなく、スコア空間での確率的反復スコアリング(stochastic iterative scoring)により候補を徐々に再スコアリングし刈り込むことで、表現力を高めつつ、解釈可能で明示的な意思決定プロセスを維持する。

2. 先行研究と比べてどこがすごい?

従来の行動ポリシーは連続生成モデル(例:拡散モデル)が主流であり、反復的ノイズ除去プロセスは表現力が高いが解釈が難しく、非現実的な行動を生成しやすいという問題があった。LDiPは、行動を摂動するのではなく、物理的に妥当な候補の大規模語彙から選択する完全離散フレームワークを導入し、スコア空間での確率的反復スコアリングにより、連続モデルに匹敵する表現力と探索能力を実現しつつ、明示的で解釈可能な決定プロセスを提供する点が新しい。

3. 技術・手法の肝は?

手法の核は、大規模な離散行動語彙を構築し、スコア空間での確率的反復スコアリング(stochastic iterative scoring)を用いて候補を段階的に再スコアリングし刈り込む点にある。これにより、候補間の細かいランキングと探索が可能になり、行動の摂動を伴わないため、物理的妥当性を保ちながら表現力を高める。完全離散的な意思決定プロセスを明示的に保持する。

4. どうやって有効だと検証した?

有効性は、エンドツーエンドのプランニング、閉ループ運転、ロボット操作、視覚言語行動設定の複数タスクで検証された。自動運転では、強力な離散および連続ベースラインを一貫して上回り、ロボット操作では連続生成ポリシーと同等以上であることを示した。

5. 議論はある?

要旨からは、LDiPが離散ポリシーでも効果的なスコアリング機構により表現力・妥当性・解釈可能性を両立できることを示したが、具体的な限界や議論(例:語彙の設計、計算コスト、スケーラビリティなど)については言及されていない。

6. 次に読むべき論文は?

要旨で参照されている関連研究として、連続生成モデル(特に拡散モデルに基づく行動ポリシー)や、離散行動ポリシーのベースラインが挙げられる。具体的には、拡散ポリシー(diffusion policy)や、行動量子化を用いた手法などが関連する。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Zhenxin Li, Nadine Chang, Xinglong Sun, Jingde Chen, Wenhao Yao, Zi Wang, Maying Shen, Yu-Gang Jiang, Zuxuan Wu, Shiyi Lan, Jose M. Alvarez

分類: cs.RO, cs.CV

原文アブストラクト

Behavior policies are often formulated as continuous generative models, whose iterative denoising processes are expressive but difficult to interpret and prone to producing implausible actions. We propose the Large Discrete Policy (LDiP), a fully discrete behavior modeling framework that selects actions from a large vocabulary of physically plausible candidates. Rather than perturbing actions, LDiP improves expressivity through stochastic iterative scoring: it progressively re-scores and prunes candidates with score-space stochasticity, enabling fine-grained ranking and exploration among plausible actions while preserving an explicit decision process. Across end-to-end planning, closed-loop driving, robotic manipulation, and vision-language-action settings, LDiP consistently outperforms strong discrete and continuous baselines in autonomous driving, and exceeds or matches continuous generative policies in robotic manipulation. These results show that discrete policies, when equipped with effective scoring mechanisms, offer an expressive, plausible, and interpretable alternative for behavior modeling. Project website: https://zhenxinli.net/LargeDiscretePolicy/.

関連論文