#111 · 主分类: 语音合成与识别
VibeVoice-ComfyUI
为微软的VibeVoice文本转语音模型提供全面的ComfyUI集成,使您能够在ComfyUI工作流程中直接实现高质量的单人和多说话人语音合成。
项目最后更新:02/18/26
GitHub Stars
1.6K
Forks数量
249
贡献者数量
4
许可证
MIT
收录理由
对ComfyUI用户来说,微软VibeVoice语音合成引擎被直接封装成节点,声音生成可以完全嵌在原有节点图里,不必另起炉灶。它既支持单人旁白,也能生成最多四个说话人的对话,还能从一段音频里克隆音色,或用自定义LoRA适配器微调声音。由于VibeVoice的代码是内置的,不依赖远程API,所有推理都在本地完成。想省显存可以开4位或8位量化,扩散步数也能自己调,在速度和质量之间取舍;CUDA、CPU和苹果M系列芯片都能跑。长脚本会自动分块,还支持插入停顿标签,处理起来不费劲。无论是游戏音频、视频配音、旁白还是互动语音内容,它都够用,而不只是跑个短demo那么简单。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。