#174 · 主分类: 语音合成与识别

e2-tts-pytorch

artificial-intelligence deep-learning text-to-speech

在Pytorch中实现E2-TTS,即"Embarrassingly Easy Fully Non-Autoregressive Zero-Shot TTS"

项目最后更新:12/20/25

GitHub Stars

517

Forks数量

52

贡献者数量

8

许可证

MIT

收录理由

语音助手、有声书流水线和配音工作流常常卡在同一道坎上:想在不重新训练的条件下捕捉新说话人的音色。这个仓库用紧凑的 PyTorch 代码实现了 E2-TTS,正是为这种零样本合成而设计的。与论文不同,它采用多流 transformer 处理文本和音频,并在每个块中施加条件;还附带一个可选的技巧,把文本直接插值到音频长度,省去时长预测。端到端训练代码由社区贡献者补齐,因此项目更像一个可用的起点,而非论文复刻。Lucas Newman 配套的 Nanospeech 仓库提供了训练配方,并为 Apple Silicon 准备了 MLX 移植版。这属于研究级软件,预处理和数据集整理得自己动手,但代码量小,改造成自己的流程并不费劲。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目