GitHub Stars
8.3K
Forks数量
640
贡献者数量
11
许可证
Apache-2.0
收录理由
Higgs Audio 是一个端到端的多模态模型,既能理解音频,也能生成听起来很自然的语音,其 v3 版本专为对话式文本转语音设计。它支持超过一百种语言,可以从一段简短的样本中零训练克隆声音,还能在生成时直接控制情感、风格和韵律。需要提前说明的是,这个代码仓库基本是历史快照:v3 的权重放在 Hugging Face 上,你可以用 SGLang-Omni 自行部署,或者直接调用 Boson 的 OpenAI 兼容语音 API。许可证值得在商业规划前仔细确认,因为 v3 属于研究与非商业用途,产生收入的使用需要单独申请商业授权。对于想要自托管多语言 TTS 基础模型而不是使用托管服务的团队,可以拉取 v3 权重并参考仓库中的部署示例。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。