#32 · 主分类: 语音合成与识别

higgs-audio

Boson AI的文本-音频基础模型

项目最后更新:06/05/26

GitHub Stars

8.3K

Forks数量

640

贡献者数量

11

许可证

Apache-2.0

收录理由

Higgs Audio 是一个端到端的多模态模型,既能理解音频,也能生成听起来很自然的语音,其 v3 版本专为对话式文本转语音设计。它支持超过一百种语言,可以从一段简短的样本中零训练克隆声音,还能在生成时直接控制情感、风格和韵律。需要提前说明的是,这个代码仓库基本是历史快照:v3 的权重放在 Hugging Face 上,你可以用 SGLang-Omni 自行部署,或者直接调用 Boson 的 OpenAI 兼容语音 API。许可证值得在商业规划前仔细确认,因为 v3 属于研究与非商业用途,产生收入的使用需要单独申请商业授权。对于想要自托管多语言 TTS 基础模型而不是使用托管服务的团队,可以拉取 v3 权重并参考仓库中的部署示例。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目