音频是随时间变化的一维信号,其波形或梅尔频谱图同样可以被逐步加噪和去噪。扩散模型在音频频谱或波形空间执行与图像类似的去噪过程,从而生成音乐、音效与语音。
在语音领域,扩散模型被用于合成自然度更高的语音、进行声音克隆与跨语种配音。以 DiT 结合条件流匹配的架构为例,模型从噪声出发,在音素序列、时长与参考音频等条件引导下生成目标说话人的音频潜表示,再经声码器解码为波形。
在音乐与音效方面,扩散模型可根据文本描述生成配乐、环境音与特效音,也能对录音做降噪与增强处理。AudioLDM、Stable Audio 等系统展示了扩散范式在音频生成中的可行性,使其成为多模态生成的重要一环。