#122 · 主分类: 语音合成与识别
metavoice-src
ai
deep-learning
pytorch
speech
speech-synthesis
text-to-speech
tts
voice-clone
zero-shot-tts
用于类人、富有表现力的 TTS 的基础模型
项目最后更新:07/30/24
GitHub Stars
4.2K
Forks数量
691
贡献者数量
12
许可证
Apache-2.0
收录理由
MetaVoice-1B 是一个拥有 12 亿参数的文本转语音模型,它的核心追求不是念得准,而是让英文语音真正带上情绪和语气。只需大约 30 秒的参考音频,就能零样本克隆美音或英音,适合需要固定声音形象的内容场景。若想更进一步,跨语言克隆可通过微调实现,维护者提到某些说话人用一分钟左右的训练数据就能得到可用效果。项目自带基于 Docker 的 Web 界面和 REST API 服务,动手前可在本地先跑通演示。对于语音应用、旁白或助手的开发团队而言,如果语调承载着表达意义,这个模型能让人直观感受到富有表现力的合成效果。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。