Perry Dong
Stanford University
収録論文 6本 ・ フィジカルAI/ロボット学習
VLA強化学習VLA/強化学習ファインチューニング模倣学習/RLファインチューニング
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- リアルタイム視覚-言語-行動ポリシーのための強化学習VLA2026/9/16
大規模VLAモデルの推論遅延による観測のずれを解消するため、遅い行動生成と速い反応的編集を分離し、強化学習でリアルタイム制御を可能にするフレームワークを提案。
- 世界モデルを用いたQ学習強化学習2026/8/17
Q学習に世界モデルを組み合わせ、実データのみで学習しつつ想像上の軌道で探索を行うことで、サンプル効率と性能を向上させる手法を提案した。
- EXPO-FT: 視覚言語行動モデルのサンプル効率的強化学習ファインチューニングVLA/強化学習ファインチューニング2026/5/1
事前学習済みの視覚言語行動(VLA)モデルを強化学習で安定かつサンプル効率的にファインチューニングするシステムEXPO-FTを提案し、高精度・動的動作を要する複数の操作タスクで完全成功率を達成した。
- 事後行動クローニング:効率的なRLファインチューニングのためのBC方策の事前学習模倣学習/RLファインチューニング2025/12/1
模倣学習で事前学習した方策がRLファインチューニングの初期値として不十分な場合があることを理論的に示し、デモンストレータ行動の事後分布をモデル化するPostBCを提案して効率的なファインチューニングを可能にした。
- ロボティクスにおけるバッチオンライン強化学習で重要な要素は何か?強化学習2025/5/1
自律収集データからのバッチオンライン強化学習において、アルゴリズムクラス・方策抽出法・方策表現力の3軸を体系的に検証し、Q関数の利用と暗黙的な方策抽出が性能向上に重要であることを示した。
- RLIF: Interactive Imitation Learning as Reinforcement Learning2023/11/1