Andrew Wagenmaker
UC Berkeley
収録論文 13本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 待ち時間に学習する:推論遅延下での汎用ロボットポリシーのRLファインチューニングRL/遅延対応2026/8/24
推論遅延がRLのマルコフ性を壊す問題に対し、非同期推論と状態拡張で遅延を隠蔽しつつRL改善を可能にするフレームワークARLIを提案。シミュレーションと実機で有効性を実証した。
- 行動チャンキングがロボット制御における行動クローニングの性能を向上させる理由ロボット制御2026/8/3
行動チャンキングの性能向上の理由を実験的に検証し、既存の仮説が不十分であることを示し、遅延ポリシーや暗黙のアンサンブル効果が重要であることを明らかにした。
- フロー逆転ステアリングによるロボット汎用ポリシーの性能向上操作2026/6/1
フローマッチングに基づく汎用ロボットポリシーに対し、不完全な行動を逆フローで潜在ノイズに変換し、近傍の高品質な行動モードへ写像する手法を提案。シミュレーションと実機でゼロショット制御や強化学習の改善に効果を示した。
- 成功訪問マッチングによるプロセス報酬学習でRLを効率化強化学習2026/6/1
スパースな報酬を、成功・失敗エピソードを判別する識別器を使って密なプロセス報酬に変換し、ロボット操作タスクのRL微調整を高速化する手法を提案した。
- 意味的強化学習による汎用ロボットポリシーの適応強化学習2026/6/1
汎用ロボットポリシーを強化学習で適応させる際、アクション空間ではなく言語プロンプト空間を最適化する手法を提案し、複雑な長期的タスクを解決できることを示した。
- RoboReward: ロボティクス向け汎用視覚言語報酬モデルVLA2026/1/1
実ロボットの大規模データセットから報酬モデル用データセットとベンチマークを構築し、4B/8Bの視覚言語報酬モデルを訓練。短期的なロボットタスクで大規模VLMを上回る性能を達成し、実機強化学習に適用した。
- パラメータマージによる視覚-言語-行動ロボット方策の頑健なファインチューニングVLA2025/12/1
ファインチューニング時に事前学習済みモデルと重みを補間することで、汎用能力を保ちつつ新しいタスクを頑健に学習する手法を提案した。
- 事後行動クローニング:効率的なRLファインチューニングのためのBC方策の事前学習模倣学習/RLファインチューニング2025/12/1
模倣学習で事前学習した方策がRLファインチューニングの初期値として不十分な場合があることを理論的に示し、デモンストレータ行動の事後分布をモデル化するPostBCを提案して効率的なファインチューニングを可能にした。
- 行動的探索:インコンテキスト適応による探索の学習VLA2025/7/1
専門家のデモデータを用いて、過去の観測と探索度合いを条件に行動を予測する長文脈生成モデルを訓練し、オンラインでの高速適応と効率的な探索を実現する手法を提案。
- 拡散ポリシーを潜在空間強化学習で操縦するVLA2025/6/1
拡散ポリシーの潜在ノイズ空間に強化学習を適用し、実世界で効率的に自律適応させる手法DSRLを提案。
- Sim-to-Realギャップの克服:探索方策の学習による実世界強化学習の効率化sim2real2024/10/1
シミュレータで直接方策を学習するのではなく、探索方策を学習して実世界に転移することで、サンプル効率を指数関数的に改善できることを理論と実験で示した。
- ASID: ロボットマニピュレーションにおけるシステム同定のための能動的探索マニピュレーション2024/4/1
少量の実世界データを用いてシミュレータを自律的に改良し、正確な制御戦略を計画する学習システムを提案。
- Optimal Exploration for Model-Based RL in Nonlinear Systems2023/6/1