Zifeng Zhuang
収録論文 12本 ・ フィジカルAI/ロボット学習
VLA強化学習安全強化学習オフライン強化学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 世界-価値-行動モデル:視覚言語行動システムのための暗黙的プランニングVLA2026/4/1
視覚言語行動(VLA)モデルに、将来の軌跡の潜在表現を学習し、価値関数で評価することで暗黙的プランニングを可能にする統一フレームワークを提案した。
- MMaDA-VLA:マルチモーダル指示と生成を統合した大規模拡散視覚-言語-行動モデルVLA2026/3/1
離散拡散を用いて将来の目標観察と行動チャンクを同一トークン空間で同時にデノイズするVLAモデルを提案し、LIBEROで98.0%の成功率を達成した。
- NFPO: 正規化フローによるロボットポリシー学習の安定化ポリシー最適化強化学習2026/3/1
ロボットの強化学習で、多峰性分布を表現できる正規化フローをポリシーとして用いる際の訓練不安定性を分析し、簡単な手法で安定化させて性能を向上させた。
- HiF-VLA: 運動表現による視覚-言語-行動モデルのための後知恵・洞察・先見VLA2025/12/1
ロボット操作のためのVLAモデルに、過去・現在・未来の運動情報を統合する世界モデルを組み込み、長期的なタスクの一貫性を向上させた研究。
- 境界から領域への監督によるオフライン安全強化学習安全強化学習2025/9/1
オフライン安全RLにおいて、コスト信号を固定予算下の境界制約として再定義し、非対称な条件付けを可能にするB2Rフレームワークを提案。38タスク中35で安全制約を満たしつつ高い報酬を達成した。
- オフライン事前学習済み方策のみを用いた効率的なオンラインRLファインチューニング強化学習2025/5/1
事前学習済みQ関数に頼らず、オフラインで学習した方策だけを使ってオンライン強化学習でファインチューニングする手法PORLを提案し、BC方策の直接改善も可能にした。
- ReinboT: 強化学習でロボットの視覚言語マニピュレーションを強化VLA2025/5/1
模倣学習ベースの視覚言語行動モデルに強化学習の累積報酬最大化を取り入れ、高密度リターン予測で混合品質データから頑健な操作方策を学習する手法を提案。
- TDMPBC:自己模倣強化学習によるヒューマノイドロボット制御強化学習2025/2/1
強化学習において、タスクに関連する可能性のある軌道を自己模倣することで、ヒューマノイドロボットの制御性能を大幅に向上させるフレームワークSIRLを提案した。
- DIDI: 拡散モデル誘導によるオフライン行動生成の多様性オフライン強化学習2024/5/23
拡散確率モデルを事前分布として用い、ラベルなしオフラインデータから多様なスキルを学習する手法を提案。
- A dynamical clipping approach with task feedback for Proximal Policy Optimization2023/12/12
- Unlock Reliable Skill Inference for Quadruped Adaptive Behavior by Skill Graph2023/11/1
- STRAPPER: Preference-based Reinforcement Learning via Self-training Augmentation and Peer Regularization2023/7/19