Pengcheng Wang
収録論文 6本 ・ フィジカルAI/ロボット学習
ロボット操作人型ロボット適応拡散ポリシー/非同期実行VLAモデルベース強化学習オンライン計画
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 逐次ロボットタスクにおける構成的一般化の診断ロボット操作2026/7/1
逐次ロボット操作タスクで、指示の組み合わせに対する一般化の失敗原因を分解し、訓練データのカバレッジ構造が重要であることを示した論文。
- CLIFT: 非侵襲的な閉ループ反復ファインチューニングによるGemini Roboticsオンデバイスの人型ロボット専門家化人型ロボット適応2026/7/1
クローズドウェイトのロボット基盤モデルを管理API経由で適応させる際、純粋な模倣学習に限定される問題を解決するため、非侵襲的な閉ループ反復ファインチューニング手法を提案し、実人型ロボットでの有効性を実証した。
- DiscreteRTC: 離散拡散ポリシーは自然な非同期実行器である拡散ポリシー/非同期実行2026/4/1
離散拡散ポリシーが本来持つインペインティング能力を活用し、非同期実行を実現する新しいポリシー「DiscreteRTC」を提案。連続的なRTCと比べて、追加コードなしで実装でき、推論コストも削減しつつ、動的タスクでの成功率が向上することを示した。
- DADP: ドメイン適応拡散ポリシーVLA2026/2/1
拡散ポリシーにドメイン表現を組み込み、未知の遷移力学にゼロショット適応する制御手法を提案。
- TD-M(PC)²: ポリシー制約による時間差分MPCの改善モデルベース強化学習2025/2/1
モデルベース強化学習における価値過大評価問題を、プランナーと学習ポリシーの不一致に起因すると分析し、ポリシー正則化項でOODクエリを減らして価値学習を改善する手法を提案。
- Residual-MPPI:連続制御のためのオンラインポリシーカスタマイズオンライン計画2024/7/1
学習済みポリシーの行動分布のみを用い、実行時にMPPIで残差行動を計画することで、追加学習なしに新しい性能指標へ数ショット/ゼロショットで適応させる手法を提案。