#88 · 主分类: 语音合成与识别
descript-audio-codec
最先进的音频编解码器,具有90倍压缩比。支持44.1kHz、24kHz和16kHz单声道/立体声音频。
项目最后更新:07/16/26
GitHub Stars
1.8K
Forks数量
188
贡献者数量
3
许可证
MIT
收录理由
这个神经编解码器能把44.1kHz音频压成8 kbps的离散码,压缩率大约90倍,同时仍能保持低伪影和高保真重建。对于音频语言模型、语音合成和音乐生成来说,它是一个很实用的基础组件。它训练好的权重是通用的,一个模型就能覆盖语音、环境声、音乐等各类音频,不需要针对不同领域重新训练,并且可以直接替换EnCodec,用在AudioLM或MusicGen这类流程里。仓库里提供了编码和解码的命令行工具,也有Python API,预训练权重支持16kHz、24kHz和44.1kHz三种采样率,你可以直接用来压缩、重建文件,或者把分词器接进自己的模型。如果想把编解码器适配到自定义采样率或数据集,仓库里也附带了训练脚本。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。