#185 · 主分类: 语音合成与识别

allosaurus

phonetics pytorch speech speech-recognition

Allosaurus是一个预训练的通用音素识别器,支持超过2000种语言。

项目最后更新:04/26/24

GitHub Stars

742

Forks数量

100

贡献者数量

8

许可证

GPL-3.0

收录理由

Allosaurus 是一个预训练的多语言音素识别工具,输入一个 wav 文件,就能输出对应的音素序列,覆盖超过 2000 种语言。这种广度让它很有实用价值:不需要自己训练声学模型,开箱即用就能得到一致的音素级转写基线。它可以通过 pip 安装,同时提供命令行和简单的 Python 接口,几行代码就能对单个文件或整个目录进行推理。还支持指定语言识别和 top-k 输出,方便对比不同方言的发音,或者为发音分析构建特征。对于处理多语言语音数据的人来说,这是一个实用的现成组件,而不只是研究演示。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目