#50 · 主分类: 语音合成与识别
MOSS-TTS
开源的高保真语音和声音生成模型系列,支持长文本TTS、多说话人对话、声音设计、音效和实时流式处理。
项目最后更新:07/26/26
GitHub Stars
4.0K
Forks数量
366
贡献者数量
19
许可证
Apache-2.0
收录理由
MOSS-TTS 是一套面向真实产品场景的语音与声音生成模型家族,并非停留在演示级别的合成效果。它既能稳定输出长段落旁白,也支持多说话人对话和角色音色设计;除了常规的文字转语音,还内置了短文本音色克隆、精细的停顿与韵律控制,以及用于中英混读等语码切换场景的显式语言标记。环境音效生成也集成在同一套代码库中,其中约一亿参数的小模型在几核 CPU 上即可完成流式推理,因此同一技术栈既能部署到云端,也能跑在端侧设备上。项目附带 SGLang、vLLM 等推理后端,并提供了基于 llama.cpp 的量化权重路径,即使在配置不高的 GPU 上也能运行,团队可以快速搭建原型,之后再用自有语音数据微调,无需从零组装整套服务框架。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。