Aviral Kumar
Carnegie Mellon University
収録論文 20本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- SeeQ: 長期的ロボットマニピュレーションのための汎用価値関数の学習マニピュレーション2026/9/18
サブタスク単位でQ値を学習し、自然言語でサブタスクを自己回帰的に予測することで、長期的なロボット操作タスクの性能を向上させる手法を提案。
- R^3: 強化学習による自然言語推論を用いたロボットの訓練ロボット操作2026/8/26
この論文は、ロボット操作タスクにおいて、視覚言語モデル(VLM)を自然言語で推論するように訓練し、その推論結果を低レベル操作ポリシーのガイドとして利用する手法を提案している。
- 最小データでの汎用ロボットポリシーの適応強化学習2026/8/1
事前学習済みのロボットポリシーが、1回のデモンストレーションと自律的なオンライン相互作用だけで新しいタスクを学習できるようにする、オフラインからオンラインへの強化学習手法MiDASを提案した。
- 競合する報酬によるLLMの過剰拒否への対処LLM安全性2026/6/30
安全トレーニングによる過剰拒否問題を、有害な推論を探索として活用しつつ安全な回答を生成する敵対的枠組みで解決する手法を提案した。
- BPP: 重要な履歴フレームに注目した長文脈ロボット模倣学習模倣学習2026/2/1
視覚言語モデルで検出したタスクに関連するキーフレームのみを条件とすることで、履歴に依存するロボットタスクの模倣学習を安定化させ、実世界タスクで成功率を大幅に向上させた。
- RaC: 復旧と修正のスケーリングによる長期的タスクのロボット学習模倣学習2025/9/1
人間の介入による復旧・修正軌道でロボット政策を微調整し、長期的タスクの効率と堅牢性を向上させる手法を提案。
- 大きく、正則化し、カテゴリカルに:高容量価値関数は効率的なマルチタスク学習者マルチタスク強化学習2025/5/29
高容量な価値モデルをクロスエントロピーで学習し、学習可能なタスク埋め込みで条件付けることで、オンライン強化学習におけるタスク干渉を解決し、マルチタスク学習をスケーラブルにする手法を提案。
- 汎用ロボット基盤モデルを価値誘導で操る:V-GPSVLA2024/10/1
オフライン強化学習で学習した価値関数を用いて汎用ロボット方策の行動を再ランク付けし、微調整なしで性能を向上させる手法を提案。
- D5RL: データ駆動型深層強化学習のための多様なデータセットオフライン強化学習2024/8/1
実世界のロボット操作・移動環境を模したシミュレーションで、スクリプト・人間操作・その他多様なデータ源を含むオフライン強化学習の新ベンチマークを提案。
- Zero-Shot Robotic Manipulation with Pretrained Image-Editing Diffusion Models2023/10/1
- Robotic Offline RL from Internet Videos via Value-Function Pre-Training2023/9/1
- Q-Transformer: Scalable Offline Reinforcement Learning via Autoregressive Q-Functions2023/9/1
- Pre-Training for Robots: Offline RL Enables Learning New Tasks from a Handful of Trials2022/10/1
- Don't Start From Scratch: Leveraging Prior Data to Automate Robotic Reinforcement Learning2022/7/1
- How to Leverage Unlabeled Data in Offline Reinforcement Learning2022/2/1
- Conservative Data Sharing for Multi-Task Offline Reinforcement Learning2021/9/1
- COMBO: Conservative Offline Model-Based Policy Optimization2021/2/1
- Conservative Safety Critics for Exploration2020/10/1
- COG: Connecting New Skills to Past Experience with Offline Reinforcement Learning2020/10/1
- The Reach-Avoid Problem for Constant-Rate Multi-Mode Systems2017/7/1