GitHub Stars
543
Forks数量
82
贡献者数量
1
许可证
MIT
收录理由
想做一个自定义的语音合成声音,通常得从零开始训练模型,成本很高。这个项目绕开了这一步,直接基于预训练的VITS模型做微调,并且把整个流程都写清楚了:准备日语的音频-文本数据集、把音频重采样成指定格式、预处理,再到多说话人训练。README里对数据需求也很坦诚,说大约五十对音频和文本就能得到不错的效果,这对想做出某个角色音色或个人语音的爱好者和小团队来说,门槛低了不少。项目还提供了Google Colab笔记本,训练和推理都能在线跑,没有自己的GPU也能用。主要限制是只支持日语数据集,所以只适合那些能接受这个条件的项目。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。