何が起きたか

2023年3月14日にarXivで公開された論文「Merging Decision Transformers: Weight Averaging for Forming Multi-Task Policies」は、異なるMuJoCo locomotion問題で個別に訓練されたDecision Transformerのサブセットをパラメータ空間で平均化(マージ)することで、集中学習なしにマルチタスクモデルを形成する手法を提案した。著者らは、共通の事前訓練済み初期化の利用、モデル容量の増加、Fisher情報によるパラメータ重要度の重み付けが、ポリシーのマージにおいて重要であると実証した。実装はGitHubで公開されている。

詳細

本研究は、言語・視覚・逐次意思決定問題における汎用トランスフォーマーモデルの構築が注目される中、集中型の学習目標・データ・計算資源を必要とせずに、複数のタスク特化ポリシーを柔軟に統合する方法を模索するものである。具体的には、MuJoCoの locomotion タスクで訓練されたDecision Transformerをパラメータ空間で平均化し、マルチタスクポリシーを形成する。 著者らは、ポリシーのマージにおける方法論的選択の重要性を強調しており、特に共通の事前訓練済み初期化を用いること、モデル容量を増やすこと、Fisher情報を用いてパラメータの重要度を重み付けすることが有効であると述べている。この方向性の研究は、マルチタスクロボティクスポリシーの形成プロセスを民主化・分散化する可能性があるとしている。

Key Facts

論文は2023年3月14日にarXivで公開された(arXiv:2303.07551v3)。[1]
提案手法は、個別に訓練されたDecision Transformerをパラメータ空間で平均化(マージ)する。[1]
検証はMuJoCoのlocomotion問題で行われた。[1]
集中学習なしでマルチタスクモデルを形成することを目指す。[1]
共通の事前訓練済み初期化の利用が重要とされる。[1]
モデル容量の増加が重要とされる。[1]
Fisher情報を用いたパラメータ重要度の重み付けが重要とされる。[1]
実装はGitHubで公開されている(https://github.com/daniellawson9999/merging-decision-transformers)。[1]

なぜ重要か

この研究は、集中型の学習プロセスに依存せずにマルチタスクのロボティクスポリシーを構築する可能性を示すものであり、ロボット学習の分散化・民主化に寄与する可能性がある。また、パラメータ空間でのポリシー統合というアプローチは、今後の汎用エージェント開発に影響を与える可能性がある。