GitHub Stars
53.3K
Forks数量
6.0K
贡献者数量
22
许可证
MIT
收录理由
VibeVoice 把长语音识别与多说话人语音合成放在同一个仓库里,一条流水线同时覆盖语音理解与生成两个方向。识别端支持单次处理长达 60 分钟的音频,自动输出说话人标签和时间戳,还能通过自定义热词来适配行业术语,适合做会议转写或通话分析这类真实业务场景,而不只是跑个演示。原生支持超过 50 种语言,微调代码和量化后的 CPU 推理引擎(无需 GPU)打通了从训练到边缘部署的完整链路。合成端则支持长文本、多说话人以及流式输入。模型已发布在 Hugging Face 上,配合 Colab 示例和 vLLM 集成,团队下载后很快就能搭起可用的语音管线。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。