何が起きたか
KTH王立工科大学の研究チームは、音声から3Dポーズ系列を生成する拡散モデル手法を発表した。論文は2022年11月17日にarXivで公開され、DiffWaveアーキテクチャを応用し、畳み込みの代わりにConformerを用いることでモデリング能力を向上させた。実験ではジェスチャーとダンス生成において最高水準のモーション品質を達成したとしている。
詳細
この研究では、拡散モデルが音声と共起する人間のモーション合成に適していると主張する。モーションは音声に対して複雑で曖昧であり、確率的な記述が必要とされるため、拡散モデルが有効だという。また、classifier-free guidanceを用いてモーションスタイルの強度を調整できることを示した。さらに、同じモデルアーキテクチャで経路駆動の移動も合成できるとしている。
Key Facts
| KTH王立工科大学の研究チームが音声駆動のモーション合成手法を発表 | [1] |
| 論文は2022年11月17日にarXivで公開された | [1] |
| DiffWaveアーキテクチャを応用し、3Dポーズ系列をモデル化 | [1] |
| 畳み込みの代わりにConformerを採用 | [1] |
| classifier-free guidanceでモーションスタイルの強度を調整可能 | [1] |
| ジェスチャーとダンス生成で最高水準のモーション品質を達成 | [1] |
| 同じモデルアーキテクチャで経路駆動の移動も合成可能 | [1] |
| スタイル補間などのためのproduct-of-expertアンサンブルも提案 | [1] |
なぜ重要か
この研究は、音声から複雑な人間のモーションを生成する際の確率的な性質に対応する手法を示しており、ダンスやジェスチャー生成の品質向上に寄与する可能性がある。また、スタイル制御やアンサンブル手法の提案は、モーション合成の応用範囲を広げるものだ。