#107 · 主分类: 语音合成与识别

alexandria-audiobook

ai audiobook audiobook-generator audiobookshelf chapter-markers dialogue-generation fastapi lora m4b multi-voice pinokio python qwen3-tts speech-synthesis text-to-speech tts voice-cloning voice-design voice-generation

AI驱动的多声音有声书生成器 — LLM脚本注释、声音克隆、声音设计、LoRA训练、逐行风格控制,并导出为MP3、分章节M4B或Audacity多轨。基于Qwen3-TTS构建。

项目最后更新:08/02/26

GitHub Stars

980

Forks数量

120

贡献者数量

8

许可证

MIT

收录理由

把一本书变成有声书,过去往往要拼凑多个TTS引擎,还得反复修同一类错误。这个项目把整条流程收拢成一条流水线:LLM先把文本拆成说话人、对白和逐行风格提示,内置的Qwen3-TTS引擎在本地把每一行渲染出来。支持从一小段参考音频克隆音色,也有文字驱动的音色设计器;如果你需要某个角色在二十章里保持声线稳定,还能用LoRA做微调。浏览器里的编辑器允许你只改错的那一行并单独重渲染该片段,不必因为一次归属错误就重新生成整整一小时音频。导出格式覆盖了听友实际在用的类型:单文件MP3、带章节的M4B(可用于Audiobookshelf和Apple Books),或者按说话人拆分的WAV多轨文件给Audacity。手头有性能尚可的NVIDIA或AMD GPU的写作者、独立出版人和业余朗读者,会发觉它相当顺手。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目