#172 · 主分类: 语音合成与识别

ComfyUI-VibeVoice

ai-voice ai-voice-clonining audio comfyui-custom-nodes-text-to-speech comfyui-nodes t2s text-to-speech tts vibevoice vibevoice-microsoft voice-cloning voice-generation

ComfyUI自定义节点,用于VibeVoice TTS。富有表现力,长文本,多说话人对话音频。

项目最后更新:09/25/25

GitHub Stars

597

Forks数量

108

贡献者数量

5

许可证

MIT

收录理由

在 ComfyUI 里搭建音频工作流的用户,会喜欢这个把微软 VibeVoice 接进节点图的插件。它能在一次输出中生成富有表现力的长对话音频,最多支持四个不同音色。模型下载、显存管理和音频处理这些琐碎环节都由节点代劳,你只需要把精力放在脚本上。混合模式值得一提:可以用 wav 或 mp3 参考音频克隆某位说话人的声音,同一段对话里其余角色则交给模型即时生成全新音色。脚本写法很灵活,既支持 [1] 标签,也沿用经典的 'Speaker 1:' 格式。注意力机制提供多种选项,配合 4-bit 量化,在显存较小的显卡上也能调节速度与内存占用。做播客、对话演示或角色旁白时,想要自然的多说话人音频又不想离开 ComfyUI,这个节点是很实际的选择。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目