Zhennan Jiang
収録論文 6本 ・ フィジカルAI/ロボット学習
強化学習/模倣学習/操作ロボット操作/強化学習VLAマニピュレーション強化学習/ロボットマニピュレーション
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 行動残差を超えて:ボトルネック潜在強化学習による実世界ロボットポリシーの操縦強化学習/模倣学習/操作2026/5/1
事前学習済みの模倣ポリシーを、行動空間ではなくボトルネック潜在空間で強化学習により微調整する手法ZPRLを提案し、シミュレーションと実世界の操作タスクで性能を向上させた。
- クリップ付き目的関数による後方最適化:生成的方策学習における効率と安定性の橋渡しロボット操作/強化学習2026/4/1
ロボット操作のための生成的方策をRLで微調整する際の不安定性とサンプル非効率を解決するため、後方推論として方策改善を定式化するPOCOフレームワークを提案。期待値最大化手順で報酬重み付き暗黙後方を方策に蒸留し、オフラインからオンラインへのパラダイムで事前分布に探索を固定する。
- WoVR: 幻覚を制御してVLAポリシーを強化学習で事後学習する信頼可能なワールドモデルシミュレータVLA2026/2/1
不完全な学習済みワールドモデルをシミュレータとして使い、キーフレーム初期化ロールアウトとモデル・ポリシー共進化で幻覚の影響を抑え、VLAポリシーを強化学習で安定に事後学習する手法を提案。
- RL-100: 実世界強化学習による高性能ロボットマニピュレーションマニピュレーション2025/10/1
拡散視覚運動ポリシーに模倣学習と強化学習を統合し、軽量な蒸留で高速制御を実現した実世界ロボットマニピュレーションのフレームワーク。8つの多様な実タスクで100%の成功率を達成。
- World4RL: 拡散世界モデルによるロボットマニピュレーションの強化学習ポリシー改善マニピュレーション2025/9/1
拡散モデルベースの世界モデルを高忠実度シミュレータとして用い、実機やシミュレータを使わずに想像環境内でマニピュレーション方策を強化学習で直接改善するフレームワークを提案。
- TeViR: 拡散モデルによるテキストから動画への報酬生成で効率的な強化学習強化学習/ロボットマニピュレーション2025/5/1
テキストから動画を生成する拡散モデルを使い、予測映像と現在の観測を比較して密な報酬を生成する強化学習手法を提案。11の複雑なロボット操作タスクでサンプル効率と性能を向上させた。