#129 · 主分类: 语音合成与识别

soundstorm-pytorch

artificial-intelligence attention-mechanism audio-generation deep-learning non-autoregressive transformers

在Pytorch中实现Google Deepmind的SoundStorm,高效并行音频生成

项目最后更新:04/24/25

GitHub Stars

1.5K

Forks数量

94

贡献者数量

5

许可证

MIT

收录理由

这个项目把DeepMind提出的SoundStorm并行音频生成方案做成了可用的PyTorch库。它的核心思路是借鉴MaskGIT的迭代式去掩码方法,作用在SoundStream编码器产生的残差向量量化码上,并用适合音频信号的Conformer结构作为主干网络。整个实现把各个模块拆分得很清楚,你可以直接用自带的训练代码在原始音频上从头训练,也能接入TextToSemantic这类模型,搭起从文本到语音波形的完整流程。对于做语音合成的人来说,最吸引人的地方在于音频解码阶段可以并行生成,不再是逐个token地挤牙膏,能显著缩短生成等待时间。项目还基于HuggingFace Accelerate提供了简洁的训练脚本,改造成本不高,上手比较顺。如果你正打算搭建TTS系统,希望解码环节跑得快而不是卡住整个流程,这份代码是个很实用的起点。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目