#131 · 主分类: 语音合成与识别
openspeech
基于PyTorch-Lightning和Hydra的开源端到端语音识别工具包。
项目最后更新:06/21/26
GitHub Stars
714
Forks数量
116
贡献者数量
9
许可证
MIT
收录理由
OpenSpeech 是一套面向端到端自动语音识别的训练工具包,其核心价值在于对 DeepSpeech2、RNN-Transducer 等已发表 ASR 模型进行了可复现的实现,并提供了英文、中文、韩文三种语言的训练配方,覆盖 LibriSpeech、AISHELL-1、KsponSpeech 等数据集。你可以直接复现论文中的实验结果,也可以通过自定义数据模块和分词器,将代码迁移到自己的数据上。由于底层基于 PyTorch-Lightning 和 Hydra,混合精度训练、多 GPU 与 TPU 训练、分层配置管理这些基础设施已经内置,省去了大量拖慢研究进度的工程琐事。需要留意的是,它定位为训练框架而非开箱即用的推理服务,使用前需自行训练或微调模型,不能指望直接加载预训练权重。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。