#49 · 主分类: 语音合成与识别

Orpheus-TTS

llm realtime tts

迈向类人语音

项目最后更新:12/05/25

GitHub Stars

6.3K

Forks数量

535

贡献者数量

14

许可证

Apache-2.0

收录理由

Orpheus 是一个基于 Llama-3b 骨干网络构建的开源文本转语音引擎,它的语言模型根基直接体现在输出上:语音带有自然的语调和节奏,而不是老式引擎那种平淡的念白。你可以通过简单的情绪标签来引导表达的丰富度,也能用一段简短参考音频克隆声音而无需微调,流式输出的延迟大约在 200 毫秒左右,很适合实时语音助手和那些不能等整段渲染完成的交互场景。仓库里既有面向日常生产环境的微调模型,也有在超过十万小时英语语音上训练的预训练模型,同时附带了数据处理脚本和示例数据集,方便你用自己的声音做微调。多语言研究版本和 Baseten 集成(支持 fp8 与 fp16 推理)让这套方案更完整,想获得更像真人说话的语音效果,团队完全有能力自己把它跑起来。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目