何が起きたか

arxiv.orgに2026年2月3日付で掲載された論文が、ドメイン適応拡散ポリシー「DADP」を提案した。DADPは、動的予測における文脈選択の時間差を拡大することで、静的ドメイン情報と変動する動的特性を教師なしで分離し、拡散生成過程にドメイン表現を注入する。移動と操作のベンチマークで、従来手法に対する優位性と汎化性を示したと報告している。

詳細

論文は、学習ベース制御における根本的な課題として、未知の遷移ダイナミクスへの汎化を挙げる。既存のドメイン表現学習では、現在ステップに隣接する文脈を選択すると、静的ドメイン情報と変動する動的特性が絡み合い、ゼロショット適応を制限すると分析する。DADPは、Lagged Context Dynamical Predictionにより、将来状態推定を過去のオフセット文脈に条件付け、時間ギャップを増やすことで過渡的特性を除去し、静的ドメイン表現を教師なしで分離する。さらに、学習したドメイン表現を事前分布のバイアスと拡散ターゲットの再構成を通じて生成過程に統合する。実験は移動と操作のベンチマークで実施され、従来法を上回る性能と汎化性を示したとしている。

Key Facts

論文「DADP: Domain Adaptive Diffusion Policy」がarxiv.orgに掲載された(2026年2月3日)。[1]
DADPは、Lagged Context Dynamical Predictionにより、履歴オフセット文脈に条件付け、時間ギャップを増やすことで静的ドメイン表現を教師なしで分離する。[1]
DADPは、学習したドメイン表現を事前分布のバイアスと拡散ターゲットの再構成により生成過程に統合する。[1]
移動と操作のベンチマークで、DADPは従来手法を上回る性能と汎化性を示したと報告されている。[1]

なぜ重要か

ロボットの制御ポリシーが未知の環境や動的変化に適応する能力は、実用化に向けた重要な課題である。DADPは、ドメイン表現の分離と拡散モデルへの統合という手法で、ゼロショット適応の可能性を広げる。今後の実環境検証や、他のモデルとの組み合わせ次第で、ロボット学習の汎化性能を大きく前進させる可能性がある。