#12 · 主分类: 语音合成与识别
CosyVoice
audio-generation
cantonese
chatbot
chatgpt
chinese
cosyvoice
cross-lingual
english
fine-grained
fine-tuning
gpt-4o
japanese
korean
multi-lingual
natural-language-generation
python
text-to-speech
tts
voice-cloning
多语言大型语音生成模型,提供推理、训练和部署全栈能力。
项目最后更新:05/25/26
GitHub Stars
23.1K
Forks数量
2.6K
贡献者数量
51
许可证
Apache-2.0
收录理由
CosyVoice 是一个基于大语言模型构建的多语种语音合成系统,覆盖了从推理、训练到部署的完整链路。它支持跨语言零样本声音克隆,只需一段简短参考音频,就能用中文、英语、日语、韩语或多种欧洲语言生成语音,同时也能处理不少汉语方言。仓库里直接提供了推理、训练和服务化代码,开发者可以从现成示例一路搭建到实际生产管线,不必自己东拼西凑。流式输出延迟最低可到150毫秒,还支持中文拼音和英文音素的发音修复,这让它在语音助手、有声书制作和本地化内容生成等场景里相当实用。对于需要快速交付TTS能力的团队来说,自然度与工程化代码兼备的项目并不多见。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。