#111 · 主分类: 语音合成与识别

VibeVoice-ComfyUI

ai-audio ai-tts ai-voice ai-voice-clone ai-voice-clonining comfyui-custom-node comfyui-custom-nodes-text-to-speech comfyui-nodes t2s text-to-speech tts vibevoice vibevoice-microsoft voice-cloning voice-generation voice-generator

为微软的VibeVoice文本转语音模型提供全面的ComfyUI集成,使您能够在ComfyUI工作流程中直接实现高质量的单人和多说话人语音合成。

项目最后更新:02/18/26

GitHub Stars

1.6K

Forks数量

249

贡献者数量

4

许可证

MIT

收录理由

对ComfyUI用户来说,微软VibeVoice语音合成引擎被直接封装成节点,声音生成可以完全嵌在原有节点图里,不必另起炉灶。它既支持单人旁白,也能生成最多四个说话人的对话,还能从一段音频里克隆音色,或用自定义LoRA适配器微调声音。由于VibeVoice的代码是内置的,不依赖远程API,所有推理都在本地完成。想省显存可以开4位或8位量化,扩散步数也能自己调,在速度和质量之间取舍;CUDA、CPU和苹果M系列芯片都能跑。长脚本会自动分块,还支持插入停顿标签,处理起来不费劲。无论是游戏音频、视频配音、旁白还是互动语音内容,它都够用,而不只是跑个短demo那么简单。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目