#107 · 主分类: 语音合成与识别
alexandria-audiobook
AI驱动的多声音有声书生成器 — LLM脚本注释、声音克隆、声音设计、LoRA训练、逐行风格控制,并导出为MP3、分章节M4B或Audacity多轨。基于Qwen3-TTS构建。
项目最后更新:08/02/26
GitHub Stars
980
Forks数量
120
贡献者数量
8
许可证
MIT
收录理由
把一本书变成有声书,过去往往要拼凑多个TTS引擎,还得反复修同一类错误。这个项目把整条流程收拢成一条流水线:LLM先把文本拆成说话人、对白和逐行风格提示,内置的Qwen3-TTS引擎在本地把每一行渲染出来。支持从一小段参考音频克隆音色,也有文字驱动的音色设计器;如果你需要某个角色在二十章里保持声线稳定,还能用LoRA做微调。浏览器里的编辑器允许你只改错的那一行并单独重渲染该片段,不必因为一次归属错误就重新生成整整一小时音频。导出格式覆盖了听友实际在用的类型:单文件MP3、带章节的M4B(可用于Audiobookshelf和Apple Books),或者按说话人拆分的WAV多轨文件给Audacity。手头有性能尚可的NVIDIA或AMD GPU的写作者、独立出版人和业余朗读者,会发觉它相当顺手。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。