#12 · 主分类: 语音合成与识别

CosyVoice

audio-generation cantonese chatbot chatgpt chinese cosyvoice cross-lingual english fine-grained fine-tuning gpt-4o japanese korean multi-lingual natural-language-generation python text-to-speech tts voice-cloning

多语言大型语音生成模型,提供推理、训练和部署全栈能力。

项目最后更新:05/25/26

GitHub Stars

23.1K

Forks数量

2.6K

贡献者数量

51

许可证

Apache-2.0

收录理由

CosyVoice 是一个基于大语言模型构建的多语种语音合成系统,覆盖了从推理、训练到部署的完整链路。它支持跨语言零样本声音克隆,只需一段简短参考音频,就能用中文、英语、日语、韩语或多种欧洲语言生成语音,同时也能处理不少汉语方言。仓库里直接提供了推理、训练和服务化代码,开发者可以从现成示例一路搭建到实际生产管线,不必自己东拼西凑。流式输出延迟最低可到150毫秒,还支持中文拼音和英文音素的发音修复,这让它在语音助手、有声书制作和本地化内容生成等场景里相当实用。对于需要快速交付TTS能力的团队来说,自然度与工程化代码兼备的项目并不多见。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目