#185 · 主分类: 语音合成与识别
allosaurus
phonetics
pytorch
speech
speech-recognition
Allosaurus是一个预训练的通用音素识别器,支持超过2000种语言。
项目最后更新:04/26/24
GitHub Stars
742
Forks数量
100
贡献者数量
8
许可证
GPL-3.0
收录理由
Allosaurus 是一个预训练的多语言音素识别工具,输入一个 wav 文件,就能输出对应的音素序列,覆盖超过 2000 种语言。这种广度让它很有实用价值:不需要自己训练声学模型,开箱即用就能得到一致的音素级转写基线。它可以通过 pip 安装,同时提供命令行和简单的 Python 接口,几行代码就能对单个文件或整个目录进行推理。还支持指定语言识别和 top-k 输出,方便对比不同方言的发音,或者为发音分析构建特征。对于处理多语言语音数据的人来说,这是一个实用的现成组件,而不只是研究演示。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。