日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
オフライン強化学習arXiv:2608.20208v1

RoMAN-Flow: ロボット操作におけるオフライン強化学習のための自己回帰正規化フローの制御

RoMAN-Flow: Taming Autoregressive Normalizing Flows for Offline Reinforcement Learning in Robotic Manipulation

シェア:XThreadsFacebookLINEはてブBluesky

自己回帰正規化フローを用いたオフライン強化学習フレームワークを提案し、サンプリング不要の尤度目的と一段階蒸留により推論遅延を削減しつつ、ロボット操作の性能を維持する。

詳しい要約

1. どんなもの?

RoMAN-Flowは、オフライン強化学習(offline RL)を用いたロボット操作のためのフレームワークで、自己回帰正規化フロー(Autoregressive Normalizing Flows, AR-NFs)を実用的にすることを目的としている。AR-NFsは表現力の高い行動モデリングと厳密な尤度評価を提供するが、逐次サンプリングによる計算コストが課題であった。RoMAN-Flowは、ポリシー最適化と展開の両段階でこのサンプリングボトルネックを解消する。具体的には、ポリシー最適化ではサンプリング不要のadvantage-weighted尤度目的を使用し、展開時には自己回帰ポリシーをone-step action generatorに蒸留することで、低遅延の行動予測を実現する。

2. 先行研究と比べてどこがすごい?

先行研究では、拡散モデルやフローマッチングに基づくロボットポリシーが一般的であるが、これらは厳密な尤度を計算できないため、尤度ベースのオフラインRLの後処理(likelihood-based offline RL post-training)に利用できない。一方、AR-NFsは厳密な尤度評価が可能だが、逐次サンプリングによる計算オーバーヘッドが大きく、実用的でなかった。RoMAN-Flowは、このAR-NFsのサンプリングボトルネックを解消し、オフラインRLでの利用を実用的にした点が新しい。

3. 技術・手法の肝は?

手法の肝は、ポリシー最適化と展開の2段階でサンプリングコストを削減することにある。ポリシー最適化では、オフラインデータセットから高advantageな行動に高い尤度を割り当てるサンプリング不要のadvantage-weighted尤度目的を導入する。これにより、自己回帰ポリシーからのサンプリングなしで最適化が可能となる。展開時には、最適化された自己回帰ポリシーをone-step action generatorに蒸留し、推論時のレイテンシを大幅に削減する。

4. どうやって有効だと検証した?

複数のシミュレーション操作ベンチマークと実世界のロボットプラットフォームでの実験を通じて、RoMAN-Flowが競争力のあるポリシー性能を達成しつつ、推論レイテンシを大幅に削減することを検証した。具体的なベンチマーク名や実機の詳細は要旨からは不明。

5. 議論はある?

要旨からは、議論の余地や制限についての詳細は不明。ただし、蒸留による性能劣化の可能性や、advantage-weighted目的の理論的保証などが考えられるが、要旨には記載がない。

6. 次に読むべき論文は?

要旨で参照されている関連研究として、拡散モデルやフローマッチングに基づくロボットポリシー、およびAR-NFsに関する研究が挙げられる。具体的には、拡散ポリシー(Diffusion Policy)やフローマッチングを用いた手法、また自己回帰正規化フローの基礎研究(例えば、Masked Autoregressive Flow)などが関連する。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Shaoxuan Wang, Guangting Zheng, Rui Huang, Zhipeng Tang, Sha Zhang, Jiajun Deng, Yanyong Zhang

分類: cs.CV

原文アブストラクト

Offline reinforcement learning improves robotic policies using previously collected data without further environment interaction. Yet prevalent diffusion- and flow-matching robot policies lack tractable likelihoods, limiting their use in likelihood-based offline RL post-training. AR-NFs offer both expressive action modeling and exact likelihood evaluation, but their sequential sampling incurs substantial sampling overhead during policy optimization and deployment. We present RoMAN-Flow (Robotic Manipulation with Autoregressive Normalizing Flows), an offline reinforcement learning framework that makes AR-NF policies practical for robotic manipulation by addressing this sampling bottleneck in both stages. During policy optimization, RoMAN-Flow employs a sampling-free, advantage-weighted likelihood objective that assigns higher likelihood to high-advantage actions from the offline dataset without sampling from the autoregressive policy. For efficient deployment, it distills the optimized autoregressive policy into a one-step action generator, enabling low-latency action prediction. Experiments across multiple simulated manipulation benchmarks and real-world robotic platforms demonstrate that RoMAN-Flow achieves competitive policy performance while substantially reducing inference latency. Code is available at https://github.com/konnyaku28/RoMAN-Flow.