何が起きたか

KTH王立工科大学の研究チームは、音声から3Dポーズ系列を生成する拡散モデル手法を発表した。論文は2022年11月17日にarXivで公開され、DiffWaveアーキテクチャを応用し、畳み込みの代わりにConformerを用いることでモデリング能力を向上させた。実験ではジェスチャーとダンス生成において最高水準のモーション品質を達成したとしている。

詳細

この研究では、拡散モデルが音声と共起する人間のモーション合成に適していると主張する。モーションは音声に対して複雑で曖昧であり、確率的な記述が必要とされるため、拡散モデルが有効だという。また、classifier-free guidanceを用いてモーションスタイルの強度を調整できることを示した。さらに、同じモデルアーキテクチャで経路駆動の移動も合成できるとしている。

Key Facts

KTH王立工科大学の研究チームが音声駆動のモーション合成手法を発表[1]
論文は2022年11月17日にarXivで公開された[1]
DiffWaveアーキテクチャを応用し、3Dポーズ系列をモデル化[1]
畳み込みの代わりにConformerを採用[1]
classifier-free guidanceでモーションスタイルの強度を調整可能[1]
ジェスチャーとダンス生成で最高水準のモーション品質を達成[1]
同じモデルアーキテクチャで経路駆動の移動も合成可能[1]
スタイル補間などのためのproduct-of-expertアンサンブルも提案[1]

なぜ重要か

この研究は、音声から複雑な人間のモーションを生成する際の確率的な性質に対応する手法を示しており、ダンスやジェスチャー生成の品質向上に寄与する可能性がある。また、スタイル制御やアンサンブル手法の提案は、モーション合成の応用範囲を広げるものだ。