Ivor W. Tsang
収録論文 3本 ・ フィジカルAI/ロボット学習
模倣学習/蒸留世界モデルオフライン強化学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 表現力豊かな教師からの敵対的二重オン方策蒸留模倣学習/蒸留2026/5/26
デモのみから学習する強化学習において、フローマッチング教師とMLP生徒を敵対的に共訓練し、報酬と行動の二つの蒸留信号でオンライン探索と局所学習を両立させる手法FA-OPDを提案。
- Olaf-World: 動画世界モデリングのための潜在行動の方向づけ世界モデル2026/2/10
ラベルなし動画から行動制御可能な世界モデルを学習するため、潜在行動を映像特徴の時間差分に整合させるSeqΔ-REPAを提案し、ゼロショット行動転移とデータ効率を改善した。
- グラフ上のトランスダクティブ報酬推論オフライン強化学習2024/2/6
限られた報酬アノテーションから報酬伝播グラフを構築し、未ラベルデータの報酬をトランスダクティブに推論する手法を提案。歩行やロボット操作タスクでオフライン強化学習の性能を向上させた。