#225 · 主分类: 语音合成与识别

vosk

lifelong-learning multilingual python semi-supervised-learning speech-recognition speech-to-text voice-recognition

VOSK 语音识别工具包

项目最后更新:07/13/22

GitHub Stars

503

Forks数量

56

贡献者数量

1

许可证

Apache-2.0

收录理由

这个仓库是 Vosk 语音系列的服务端核心,围绕“终身学习”的识别理念构建。它不走常规神经声学模型的老路,而是把短音频片段打上指纹,存入基于 LSH 哈希的信号数据库,解码时通过查表来推断音素。这样的设计让它能在普通硬件上训练超大规模语音语料,而且想修正或扩展识别行为,只需往库里加样本就行。对于研究检索式或持续更新的语音识别团队来说,这份 Python 索引和验证脚本是个不错的起点,但要注意它是研究代码:索引体积巨大,泛化能力也存疑,正式的生产 API 在另一个项目 vosk-api 里。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目