#172 · 主分类: 语音合成与识别
ComfyUI-VibeVoice
ComfyUI自定义节点,用于VibeVoice TTS。富有表现力,长文本,多说话人对话音频。
项目最后更新:09/25/25
GitHub Stars
597
Forks数量
108
贡献者数量
5
许可证
MIT
收录理由
在 ComfyUI 里搭建音频工作流的用户,会喜欢这个把微软 VibeVoice 接进节点图的插件。它能在一次输出中生成富有表现力的长对话音频,最多支持四个不同音色。模型下载、显存管理和音频处理这些琐碎环节都由节点代劳,你只需要把精力放在脚本上。混合模式值得一提:可以用 wav 或 mp3 参考音频克隆某位说话人的声音,同一段对话里其余角色则交给模型即时生成全新音色。脚本写法很灵活,既支持 [1] 标签,也沿用经典的 'Speaker 1:' 格式。注意力机制提供多种选项,配合 4-bit 量化,在显存较小的显卡上也能调节速度与内存占用。做播客、对话演示或角色旁白时,想要自然的多说话人音频又不想离开 ComfyUI,这个节点是很实际的选择。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。