Erdem Bıyık
University of Southern California
収録論文 41本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ITA-LaCAM: 割当を考慮した構成空間探索による完全かつスケーラブルなTAPFソルバ群制御2026/9/13
エージェントの目標割当と衝突回避経路計画を同時に行うTAPF問題に対し、割当を構成空間探索に統合した完全ソルバを提案し、大規模ベンチマークで高い成功率と効率を示した。
- 部分空間推論による選好からの効率的な能動報酬学習報酬学習2026/9/3
選好に基づく報酬学習において、拡張カルマンフィルタを低次元部分空間で適用し、報酬モデルの不確実性を効率的に追跡する手法を提案した。
- 理由付き選好フィードバックからの因果的に頑健な報酬学習報酬学習2026/3/1
選好ベースの報酬学習において、自然言語の理由を活用して因果的な手がかりを提供し、スプリアスな特徴への依存を減らすフレームワークReCouPLeを提案した。
- Judgelight: 閉部分歩行の圧縮によるマルチエージェント経路探索の軌道レベル事後最適化群制御2026/1/1
学習ベースのMAPFソルバが生成した実行可能だが無駄な動きを含む軌道に対し、閉部分歩行を圧縮して冗長な動きを除去する事後最適化手法を提案し、ILPで厳密に解くことでコストを約20%削減した。
- AutoFocus-IL: VLMによる顕著性マップで人間アノテーション不要のデータ効率の良い視覚模倣学習模倣学習2025/11/1
視覚言語モデルを使ってデモ中の重要物体を自動特定し、時間的顕著性マップを生成して模倣学習ポリシーを正則化することで、人間の注視データなしにデータ効率と汎化性能を向上させる手法を提案。
- ロボットが人間より上手くなる:制約付き実演者からの学習模倣学習2025/10/1
制約のある実演から状態のみの報酬を推定し、より短く効率的な軌道を探索することで、模倣学習を超える性能を実現した。
- 構造的最大化可能なQ関数によるアクターフリー連続制御連続制御/強化学習2025/10/1
連続行動空間での制御において、アクターを別途学習せずにQ関数の構造的最大化を利用する純粋な価値ベース強化学習フレームワークを提案し、標準的なシミュレーションタスクで従来手法と同等以上の性能とサンプル効率を達成した。
- PEEK: ロボットマニピュレーションポリシーのゼロショット汎化のための誘導と最小画像表現マニピュレーション2025/9/1
VLMを使ってエンドエフェクタ経路とタスク関連マスクを予測し、ポリシーに必要な最小限の手がかりを与えることで、シミュレーションのみで訓練したポリシーの実世界ゼロショット汎化を大幅に向上させる手法を提案。
- 視線を用いた正則化による模倣学習の因果的混乱の緩和模倣学習2025/7/1
人間の視線データを模倣学習の正則化に利用し、因果的混乱を軽減する手法GABRILを提案。AtariとCARLAで有効性を検証。
- 手の軌道検索によるロボットの高速適応マニピュレーション2025/5/1
人間の手のデモンストレーションからロボットの動作データを検索し、4分以内に新しいマニピュレーションタスクを学習する手法を提案。
- RAILGUN: 異なる環境とタスクにまたがるマルチエージェント経路探索のための統合畳み込みポリシー群制御2025/3/1
マルチエージェント経路探索(MAPF)において、地図ベースのCNNアーキテクチャを用いた初の集中型学習ポリシーを提案し、未知の地図やエージェント数に対するゼロショット汎化性能を示した。
- マルチエージェント逆Q学習による模倣学習マルチエージェント強化学習2025/3/1
他エージェントの方策で周辺化したクリティックを学習し、単一エージェントのsoft-Q IRLの最適化基準を適用することで、マルチエージェントの逆強化学習を高効率化した手法MAMQLを提案。
- IMPACT: 視覚言語モデルによる許容可能な接触軌道を伴う知的動作計画動作計画2025/3/1
視覚言語モデルで環境の意味を理解し、接触を許容できる物体を判断して、接触を伴う動作計画を効率的に行うフレームワークを提案した。
- MILE: モデルベース介入学習模倣学習2025/2/1
専門家の介入データと非介入時のフィードバックを活用し、モデルベースで介入を定式化することで、わずかな介入からロボットの模倣学習を効率的に行う手法を提案。
- NaVILA: 脚式ロボットのための視覚-言語-行動モデルによるナビゲーションVLA2024/12/1
脚式ロボットの視覚言語ナビゲーションにおいて、VLAモデルで「75cm前進」のような中間行動を生成し、それを強化学習による歩行ポリシーで実行する2階層フレームワークを提案した論文。
- 複雑なQ関数における決定論的方策勾配の準最適性の緩和強化学習2024/10/1
強化学習において、Q関数の局所最適に陥りやすい問題を解決するため、複数の行動候補から最良を選び、Q関数を繰り返し近似するSAVOアーキテクチャを提案し、複雑なタスクでの性能向上を実証した。
- 比較言語フィードバックによる軌道改善と報酬学習報酬学習2024/10/1
軌道データと言語フィードバックを統合した潜在空間を学習し、比較言語フィードバックからロボット軌道を反復改善しつつ人間の選好を報酬関数として学習する手法を提案した。
- ViSaRL: 人間の顕著性に導かれた視覚強化学習VLA2024/3/1
人間の視覚的注意(顕著性)を強化学習に組み込み、高次元画像入力からの効率的な視覚表現学習を実現し、サンプル効率・成功率・汎化性能を向上させた。
- 選好に基づく報酬学習のための汎用的獲得関数選好学習2024/3/1
選好クエリの生成において、報酬パラメータの完全な特定ではなく、行動等価クラスを学習することを目的とした汎用的な獲得関数を提案し、情報利得基準よりも優れた性能を示した。
- Batch Active Learning of Reward Functions from Human Preferences2024/2/1
- RoboCLIP: One Demonstration is Enough to Learn Robot Policies2023/10/1
- Active Reward Learning from Online Preferences2023/2/1
- Learning Preferences for Interactive Autonomy2022/10/1
- Leveraging Smooth Attention Prior for Multi-Agent Trajectory Prediction2022/3/1
- Partner-Aware Algorithms in Decentralized Cooperative Bandit Teams2021/10/1
- Learning Reward Functions from Scale Feedback2021/10/1
- Learning Multimodal Rewards from Rankings2021/9/1
- APReL: A Library for Active Preference-based Reward Learning Algorithms2021/8/1
- Incentivizing Efficient Equilibria in Traffic Networks with Mixed Autonomy2021/6/1
- Preference-based Learning of Reward Function Features2021/3/1
- ROIAL: Region of Interest Active Learning for Characterizing Exoskeleton Gait Preference Landscapes2020/11/1
- Multi-Agent Safe Planning with Gaussian Processes2020/8/1
- Reinforcement Learning based Control of Imitative Policies for Near-Accident Driving2020/7/1
- Learning Reward Functions from Diverse Sources of Human Feedback: Optimally Integrating Demonstrations and Preferences2020/6/1
- Active Preference-Based Gaussian Process Regression for Reward Learning2020/5/1
- Asking Easy Questions: A User-Friendly Approach to Active Reward Learning2019/10/1
- Learning How to Dynamically Route Autonomous Vehicles on Shared Roads2019/9/1
- Efficient and Safe Exploration in Deterministic Markov Decision Processes with Unknown Transition Models2019/4/1
- The Green Choice: Learning and Influencing Human Decisions on Shared Roads2019/4/1
- Batch Active Preference-Based Learning of Reward Functions2018/10/1
- Altruistic Autonomy: Beating Congestion on Shared Roads2018/10/1