#95 · 主分类: 语音合成与识别
MOSS-TTSD
MOSS-TTSD 是一个口语对话生成模型,专为表现力丰富的多说话人合成而设计。它具备长上下文建模、灵活的说话人控制以及多语言支持,并可从短音频参考实现零样本语音克隆。
项目最后更新:07/26/26
GitHub Stars
1.4K
Forks数量
136
贡献者数量
10
许可证
Apache-2.0
收录理由
多数语音合成模型只能让一个音色干净地念完一段文字,一旦内容听起来像两个人对话,效果就很容易崩掉。MOSS-TTSD 专为这类场景设计:输入一段带多个说话人的脚本,它能生成连贯且情绪一致的连续对话,并且可以长时间稳定输出。你可以自由控制谁在说话,模型支持多种语言,零样本克隆只需很短的一段参考音频就能复现某个已知音色来塑造新角色,无需针对每个说话人单独训练。如果你在做有声书、配音、体育解说或其他对话密集的内容,这个项目值得一试。模型权重和在线演示空间都已公开,动手搭建之前可以先听一听实际效果。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。