何が起きたか

KTH王立工科大学の研究チームは、音声から3Dポーズ系列を生成する拡散モデル手法を発表した。論文は2022年11月17日にarXivで公開され、DiffWaveアーキテクチャを応用し、畳み込みの代わりにConformerを用いることでモデリング能力を向上させた。実験ではジェスチャーとダンス生成において最高水準のモーション品質を達成したとしている。

詳細

この研究では、拡散モデルが音声と共起する人間のモーション合成に適していると主張する。モーションは音声に対して複雑で曖昧であり、確率的な記述が必要とされるため、拡散モデルが有効だという。また、classifier-free guidanceを用いてモーションスタイルの強度を調整できることを示した。さらに、同じモデルアーキテクチャで経路駆動の移動も合成できるとしている。

Key Facts

KTH王立工科大学の研究チームが音声駆動のモーション合成手法を発表出典一覧
論文は2022年11月17日にarXivで公開された出典一覧
DiffWaveアーキテクチャを応用し、3Dポーズ系列をモデル化出典一覧
畳み込みの代わりにConformerを採用出典一覧
classifier-free guidanceでモーションスタイルの強度を調整可能出典一覧
ジェスチャーとダンス生成で最高水準のモーション品質を達成出典一覧
同じモデルアーキテクチャで経路駆動の移動も合成可能出典一覧
スタイル補間などのためのproduct-of-expertアンサンブルも提案出典一覧

なぜ重要か

この研究は、音声から複雑な人間のモーションを生成する際の確率的な性質に対応する手法を示しており、ダンスやジェスチャー生成の品質向上に寄与する可能性がある。また、スタイル制御やアンサンブル手法の提案は、モーション合成の応用範囲を広げるものだ。