#13 · 主分类: 语音合成与识别
Speech
一个可扩展的生成式AI框架,专为从事大型语言模型、多模态和语音AI(自动语音识别和文本转语音)的研究人员和开发者设计。
项目最后更新:08/29/26
GitHub Stars
18.4K
Forks数量
3.6K
贡献者数量
504
许可证
Apache-2.0
收录理由
NeMo Speech 为做转写、语音助手或语音合成的团队提供了一套相当完整的开源工具链。它把自动语音识别、语音翻译、说话人识别与分离、以及文本转语音的训练、微调和部署都放在 PyTorch 生态里,覆盖了从研究到落地的常见路径。项目持续发布预训练权重,比如支持可调延迟的流式 ASR 模型,以及多语种 TTS 音色,很多场景不必从零开始训练。研究者可以借助可复现的训练脚本和教程快速上手,工程师也能找到把模型推向生产的可行方案。它直接叠加在已有的 Python 和 PyTorch 环境上,不强制绑定特定运行环境,对已经自建基础设施的团队来说很友好。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。