Ilias Kazantzidis
収録論文 1本 ・ フィジカルAI/ロボット学習
強化学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 人間の選好と正当化に基づくワールドモデルを用いた安全なエージェント行動の学習強化学習2026/7/14
未知の環境で報酬関数が使えない安全重視のタスクに対し、人間の選好とその理由(正当化)を活用して報酬モデルを学習し、ワールドモデルとモデル予測制御で安全な方策を直接展開する手法DROPJを提案した。
世界のフィジカルAIを、日本語で。
収録論文 1本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
未知の環境で報酬関数が使えない安全重視のタスクに対し、人間の選好とその理由(正当化)を活用して報酬モデルを学習し、ワールドモデルとモデル予測制御で安全な方策を直接展開する手法DROPJを提案した。