Yashwanthi Anand
収録論文 2本 ・ フィジカルAI/ロボット学習
多目的計画人間フィードバック学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 文脈依存の辞書式報酬選好に基づく多目的計画多目的計画2025/2/1
文脈ごとに目的の優先順位が変わる状況で、専門家の軌跡から状態と文脈の対応をベイズ推定し、各順序の政策を統合して巡回のない政策を計画する枠組みを提案した。
- 人間フィードバックからの報酬学習のための適応的クエリ人間フィードバック学習2024/12/1
不安全行動に対するペナルティ関数を、複数形式の人間フィードバックから効率的に学習するため、クエリ状態とフィードバック形式を情報利得に基づいて適応的に選択する手法を提案した。