#3 · 主分类: 语音合成与识别

VibeVoice

开源前沿语音AI

项目最后更新:07/24/26

GitHub Stars

53.3K

Forks数量

6.0K

贡献者数量

22

许可证

MIT

收录理由

VibeVoice 把长语音识别与多说话人语音合成放在同一个仓库里,一条流水线同时覆盖语音理解与生成两个方向。识别端支持单次处理长达 60 分钟的音频,自动输出说话人标签和时间戳,还能通过自定义热词来适配行业术语,适合做会议转写或通话分析这类真实业务场景,而不只是跑个演示。原生支持超过 50 种语言,微调代码和量化后的 CPU 推理引擎(无需 GPU)打通了从训练到边缘部署的完整链路。合成端则支持长文本、多说话人以及流式输入。模型已发布在 Hugging Face 上,配合 Colab 示例和 vLLM 集成,团队下载后很快就能搭起可用的语音管线。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目