#125 · 主分类: 语音合成与识别

audiolm-pytorch

artificial-intelligence attention-mechanisms audio-synthesis deep-learning transformers

AudioLM的PyTorch实现,这是一种出自Google Research的SOTA语言建模方法,用于音频生成。

项目最后更新:01/12/25

GitHub Stars

2.6K

Forks数量

277

贡献者数量

20

许可证

MIT

收录理由

Google 的 AudioLM 论文提出,音频生成可以视为语言建模问题:先把声音压缩成离散 token,再让模型预测下一个 token。这个 PyTorch 复现版本把整条流水线都给你,编码端可选 SoundStream 或 EnCodec,后面接一个基于 token 序列训练的 transformer。它在原论文之外还加了 classifier-free guidance 和 T5 条件注入,因此可以直接做文本到音频,甚至搭出 VALL-E 风格的文字转语音,不必再从好几个仓库里拼零件。如果你已经熟悉 transformer 训练,会发现这是一个很实用的实验起点,也方便把方法迁移到自己的音频数据上。当然,数据与算力得自己准备,它本质上是研究代码,不是托管服务。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目