Mengdi Wang
Princeton University
収録論文 6本 ・ フィジカルAI/ロボット学習
フローマッチング強化学習VLAsim2real失敗検出具現化AI/材料科学RLHF
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- タイムステップ重み付け:ELBOベースフローマッチング強化学習の有効性を左右する隠れた鍵フローマッチング強化学習2026/9/26
ELBOベースの強化学習におけるタイムステップ重み付けが性能に与える影響を分析し、報酬地形と学習段階に応じた適応的な重み付け手法を提案した。
- 未来予測を超えて:ロボット制御のための生成的適応としてのデノイジングVLA2026/9/23
事前学習済み生成DiTを制御に適応させる際、未来の視覚予測は不要であり、現在の観測をデノイズする軌跡そのものが制御への有効なインターフェースとなることを示し、学習効率と性能を両立する手法NowWAMを提案した。
- WorldContact: 接触中心の世界モデルによるスケーラブルなロボット学習sim2real2026/9/17
変形物体操作のための接触中心の世界モデルを提案し、限られた軌道データから効率的に追加学習データを生成して、実機ロボットのポリシー適応を成功させた。
- 先見: 行動条件付きワールドモデル潜在表現による長期的ロボット操作の失敗検出失敗検出2026/6/1
長期的なロボット操作タスクにおいて、最終的な成功/失敗ラベルのみを用いて、行動条件付きワールドモデルの潜在表現から失敗を検出するフレームワークを提案した。
- Qumus: 具現化AI量子材料実験者の実現具現化AI/材料科学2026/5/1
ロボット実験室に具現化したマルチモーダル・マルチエージェントAIシステムQumusを開発し、グラフェン生成やvdW積層によるナノデバイス作製など、量子材料の自律的な実験サイクルを初めて実現した。
- MaxMin-RLHF:多様な人間選好へのアラインメントRLHF2024/2/1
単一報酬モデルのRLHFでは人間選好の多様性を表現できないことを示し、選好分布の混合をEMで学習して平等主義的なMaxMin目的で方策を最適化する手法を提案した論文。