#158 · 主分类: 语音合成与识别
athena
一个基于序列到序列的语音处理引擎的开源实现
项目最后更新:12/02/22
GitHub Stars
966
Forks数量
197
贡献者数量
37
许可证
Apache-2.0
收录理由
Athena 是一个基于 TensorFlow 的端到端语音处理引擎,适合那些希望在同一框架内完成从模型训练到部署的团队。它覆盖了语音识别(包括混合注意力/CTC 架构和流式识别)、语音合成(FastSpeech 系列,仓库中也有 Tacotron2 和 HiFi-GAN 的声码器)、语音活动检测以及关键词唤醒等任务。项目提供了 AISHELL-1、LibriSpeech、GigaSpeech 和 LJSpeech 等公开数据集上的实验配置和结果对照,便于复现基线后再针对自有数据调整。生产部署方面,C++ 运行时支持 WFST 解码,并带有 TensorFlow C++ 本地服务器用于模型服务;同时自带的 Python 特征提取器不依赖 Kaldi,免去了相关工具链的学习成本。对于研究者和应用工程师来说,如果想在一个项目里同时获得训练配方和部署路径,Athena 是个值得考虑的选择,不过其最后一次较大规模的更新停留在 2022 年。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。