#145 · 主分类: 语音合成与识别

audio-diffusion-pytorch

artificial-intelligence audio-generation deep-learning denoising-diffusion

使用扩散模型生成音频,基于PyTorch。

项目最后更新:06/12/23

GitHub Stars

2.1K

Forks数量

175

贡献者数量

5

许可证

MIT

收录理由

这个PyTorch库为直接在原始音频波形上训练扩散模型提供了完整的组件,无需先转换成频谱图或潜变量。它内置了可配置的U-Net主干网络、多种扩散方法和采样器,覆盖无条件生成、文本条件生成、扩散自编码、上采样以及声码器等任务。核心的扩散与采样逻辑不依赖具体数据维度,稍微调整就能复用到其他格式的数据上。需要留意的是,仓库没有提供预训练权重,README中的配置示例仅作示意,论文Moûsai中描述了实验实际采用的参数。因此,它更适合作为研究基础和教学工具,而不是开箱即用的音频生成方案。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目