Amy Zhang
University of Texas at Austin
収録論文 31本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 双因果最適輸送による微分可能な双模倣距離フレームワーク模倣学習2026/9/29
双模倣距離(双因果最適輸送)を線形計画問題として定式化し、その勾配を閉形式で求めることで、状態圧縮・モデル学習・模倣学習に応用可能な微分可能アルゴリズムを提案した。
- 先読み:ナビゲーションに重要な手がかりに関する反復推論ナビゲーション2026/6/1
事前学習済み視覚言語モデルを用いて、疎な言語指示からのナビゲーションにおいて、環境の手がかりを反復的に提案・批評することで、プラン依存の手がかりを発見し、移動計画を改善するフレームワークを提案した。
- 正則化潜在ダイナミクス予測は行動基盤モデルの強力なベースラインである強化学習2026/3/1
ゼロショット強化学習のための状態特徴学習において、複雑な表現学習目的が本当に必要かを検証し、潜在空間での次状態予測に直交性正則化を加えたシンプルな手法RLDPが、既存の複雑な手法と同等以上の性能を達成することを示した。
- オフライン型マルチエージェント強化学習の安定化レシピマルチエージェント強化学習2026/3/1
オフラインMARLにおける非線形価値分解の不安定性を分析し、スケール不変な価値正規化(SVN)を提案して安定な学習を実現する手法を提案した論文。
- 因子分解型潜在行動ワールドモデルワールドモデル2026/2/18
動画から潜在行動を学習する際、シーンを複数の独立因子に分解し、各因子が独自の潜在行動を推論・予測するフレームワークFLAMを提案。複数エンティティが同時に動く複雑な環境での予測精度と表現品質を向上させ、下流の政策学習を容易にする。
- ロボットの失敗検出と推論のための自己洗練型視覚言語モデルVLA2026/2/1
ロボットの失敗検出と推論をマルチタスクの自己洗練プロセスとして定式化し、疎な二値ラベルと少数の詳細な推論アノテーションを組み合わせて学習するARMORを提案。推論時には複数の洗練軌跡から自信度の高い予測を選択し、失敗検出率と推論性能で従来手法を大幅に上回る。
- エンティティ中心の階層型強化学習と因子分解サブゴール拡散階層型強化学習2026/2/1
複数エンティティ環境での長期目標タスクに対し、価値ベースのGCRLエージェントと因子分解サブゴール生成拡散モデルを組み合わせた階層型オフライン強化学習手法を提案し、疎報酬の画像ベース長期タスクで成功率を大幅に向上させた。
- フローマッチングによるマルチエージェント協調群制御2025/11/1
フローベースの協調行動表現を学習し、分散型ワンステップ方策に蒸留することで、拡散モデル並みの性能を保ちつつ推論を約14.5倍高速化したマルチエージェント強化学習フレームワーク。
- ロボティクス向け大規模並列マルチタスク強化学習のベンチマークマルチタスク強化学習2025/7/1
GPU加速シミュレータIsaacGym上で50の操作タスクと20の歩行タスクからなるマルチタスク強化学習ベンチマークMTBenchを構築し、複数のアルゴリズムを統一的に評価した。
- 目標条件付き強化学習のためのヌル反事実的因子相互作用目標条件付き強化学習2025/5/6
物体中心タスクで後知恵リラベリングが失敗する問題に対し、原因物体が存在しなければ対象物体の遷移が変わったはずという「ヌル反事実」で相互作用を定義し、それを後知恵リラベリングと組み合わせて学習効率を改善する手法を提案した。
- 行動基盤モデルの高速適応強化学習2025/4/1
事前学習済み行動基盤モデルのゼロショット方策を、低次元タスク埋め込み空間での探索によりオンライン数ステップで高速適応させる手法を提案。
- CREStE: インターネット規模の事前知識と反事実ガイダンスによるスケーラブルな地図なしナビゲーションナビゲーション2025/3/1
視覚基盤モデルの蒸留と反事実逆強化学習を組み合わせ、未知の都市・オフロード環境でも長距離を地図なしで走行できるナビゲーション手法を提案。
- EC-Diffuser: エンティティ中心の行動生成によるマルチオブジェクト操作マニピュレーション2024/12/1
物体中心表現とエンティティ中心Transformer、拡散モデルを組み合わせ、オフライン画像データからマルチオブジェクト操作を学習し、未見の物体・目標の組み合わせへゼロショット汎化を実現した。
- RLZero: ドメイン内教師なしで言語から直接方策を推論VLA2024/12/1
言語指示から動画生成モデルで想像した観測を対象環境に投影し、教師なし強化学習で事前学習したエージェントが即座に模倣することで、追加学習なしに言語から行動を生成する手法を提案。
- SkiLD: 因子間相互作用に導かれた教師なしスキル発見教師なし強化学習2024/10/1
状態を因子に分解し、因子間の多様な相互作用を引き起こすスキルを教師なしで学習する手法を提案。家庭環境ロボットなど長期的な疎報酬タスクで既存手法を上回る。
- 大規模言語モデルフィードバックによる意思決定エージェントのためのオンライン内的報酬強化学習/LLM報酬2024/10/1
LLMのフィードバックを非同期で利用し、RL方策と内的報酬関数を同時に学習する分散アーキテクチャONIを提案。NetHackで最先端性能を達成し、大規模オフラインデータセットを不要にした。
- オフラインデータセットを用いた観察からの模倣学習への双対アプローチ模倣学習2024/6/1
専門家の行動データなしに観察のみから模倣するため、双対性原理に基づく多段効用関数を直接学習するDILOを提案し、高次元観察でも性能を向上させた。
- ロボットエアホッケー:強化学習のためのマニピュレーションテストベッドsim2real2024/5/1
ロボットエアホッケーを題材に、到達からブロック押し出しまで多様なタスクと2つのシミュレータ・実機を含む強化学習テストベッドを構築し、模倣学習・オフラインRL・スクラッチRLで評価した。
- SMORE: Score Models for Offline Goal-Conditioned Reinforcement Learning2023/11/1
- $f$-Policy Gradients: A General Framework for Goal Conditioned RL using $f$-Divergences2023/10/1
- Generalization Across Observation Shifts in Reinforcement Learning2023/6/1
- LIV: Language-Image Representations and Rewards for Robotic Control2023/6/1
- Fairness-Sensitive Policy-Gradient Reinforcement Learning for Reducing Bias in Robotic Assistance2023/6/1
- Neural Constraint Satisfaction: Hierarchical Abstraction for Combinatorial Generalization in Object Rearrangement2023/3/1
- Dual RL: Unification and New Methods for Reinforcement and Imitation Learning2023/2/1
- VIP: Towards Universal Visual Reward and Representation via Value-Implicit Pre-Training2022/10/1
- Robust Policy Learning over Multiple Uncertainty Sets2022/2/1
- Model-Invariant State Abstractions for Model-Based Reinforcement Learning2021/2/1
- Multi-Task Reinforcement Learning with Context-based Representations2021/2/1
- Intervention Design for Effective Sim2Real Transfer2020/12/1
- Improving Sample Efficiency in Model-Free Reinforcement Learning from Images2019/10/1