#158 · 主分类: 语音合成与识别

athena

asr ctc deployment sequence-to-sequence speaker-recognition speech-recognition speech-synthesis tensorflow transformer tts unsupervised-learning wfst

一个基于序列到序列的语音处理引擎的开源实现

项目最后更新:12/02/22

GitHub Stars

966

Forks数量

197

贡献者数量

37

许可证

Apache-2.0

收录理由

Athena 是一个基于 TensorFlow 的端到端语音处理引擎,适合那些希望在同一框架内完成从模型训练到部署的团队。它覆盖了语音识别(包括混合注意力/CTC 架构和流式识别)、语音合成(FastSpeech 系列,仓库中也有 Tacotron2 和 HiFi-GAN 的声码器)、语音活动检测以及关键词唤醒等任务。项目提供了 AISHELL-1、LibriSpeech、GigaSpeech 和 LJSpeech 等公开数据集上的实验配置和结果对照,便于复现基线后再针对自有数据调整。生产部署方面,C++ 运行时支持 WFST 解码,并带有 TensorFlow C++ 本地服务器用于模型服务;同时自带的 Python 特征提取器不依赖 Kaldi,免去了相关工具链的学习成本。对于研究者和应用工程师来说,如果想在一个项目里同时获得训练配方和部署路径,Athena 是个值得考虑的选择,不过其最后一次较大规模的更新停留在 2022 年。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目