#50 · 主分类: 语音合成与识别

MOSS-TTS

audio audio-tokenizer llm multimodal text-to-speech voice-cloning

开源的高保真语音和声音生成模型系列,支持长文本TTS、多说话人对话、声音设计、音效和实时流式处理。

项目最后更新:07/26/26

GitHub Stars

4.0K

Forks数量

366

贡献者数量

19

许可证

Apache-2.0

收录理由

MOSS-TTS 是一套面向真实产品场景的语音与声音生成模型家族,并非停留在演示级别的合成效果。它既能稳定输出长段落旁白,也支持多说话人对话和角色音色设计;除了常规的文字转语音,还内置了短文本音色克隆、精细的停顿与韵律控制,以及用于中英混读等语码切换场景的显式语言标记。环境音效生成也集成在同一套代码库中,其中约一亿参数的小模型在几核 CPU 上即可完成流式推理,因此同一技术栈既能部署到云端,也能跑在端侧设备上。项目附带 SGLang、vLLM 等推理后端,并提供了基于 llama.cpp 的量化权重路径,即使在配置不高的 GPU 上也能运行,团队可以快速搭建原型,之后再用自有语音数据微调,无需从零组装整套服务框架。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目