#145 · 主分类: 语音合成与识别
audio-diffusion-pytorch
artificial-intelligence
audio-generation
deep-learning
denoising-diffusion
使用扩散模型生成音频,基于PyTorch。
项目最后更新:06/12/23
GitHub Stars
2.1K
Forks数量
175
贡献者数量
5
许可证
MIT
收录理由
这个PyTorch库为直接在原始音频波形上训练扩散模型提供了完整的组件,无需先转换成频谱图或潜变量。它内置了可配置的U-Net主干网络、多种扩散方法和采样器,覆盖无条件生成、文本条件生成、扩散自编码、上采样以及声码器等任务。核心的扩散与采样逻辑不依赖具体数据维度,稍微调整就能复用到其他格式的数据上。需要留意的是,仓库没有提供预训练权重,README中的配置示例仅作示意,论文Moûsai中描述了实验实际采用的参数。因此,它更适合作为研究基础和教学工具,而不是开箱即用的音频生成方案。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。