#104 · 主分类: 语音合成与识别
conformer
[非官方] PyTorch实现《Conformer:用于语音识别的卷积增强Transformer》(INTERSPEECH 2020)
项目最后更新:06/29/26
GitHub Stars
1.1K
Forks数量
192
贡献者数量
9
许可证
Apache-2.0
收录理由
这个仓库把 Conformer 编码器单独拎了出来,做成一份干净的 PyTorch 实现。想研究这种卷积增强 Transformer 的语音研究者,不必为了跑通一个完整 ASR 框架而安装一堆依赖。代码只聚焦模型本身,擅长同时捕捉音频序列里的局部和全局模式,README 里还演示了怎么接进 CTC 训练循环。由于只包含模型,它更适合当作搭建系统的积木,或者用来对照论文理解结构细节,而不是开箱即用的完整识别器。项目维护者建议需要端到端训练时去用 OpenSpeech。代码风格遵循 PEP-8,紧凑好读,改起来也顺手,不过数据管道和损失函数得自己准备。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。