#155 · 主分类: 语音合成与识别

chaplin

auto-avsr avsr llm ollama speech-recognition speech-to-text vsr

一个实时的无声语音识别工具。

项目最后更新:11/02/25

GitHub Stars

752

Forks数量

90

贡献者数量

1

许可证

MIT

收录理由

Chaplin 通过摄像头读取唇部动作,将无声默念的词语实时转换为文字,并借助本地大模型对识别结果进行纠错,最终把修正后的文本直接输入到光标所在位置。这种视觉语音识别方案为语音转文字提供了另一种思路,适合在安静环境中免手输入、用于无障碍交互实验,或者作为一项有趣的技术演示。它的部署方式比普通应用更偏开发者向:需要下载 Auto-AVSR 模型权重、运行 Ollama 并加载一个小型 Qwen 模型,再通过命令行启动。因此,它更适合习惯自行组装本地组件的开发者,而非期待一键安装的普通用户。由于整个流程都在本地完成,它也为将视觉语音识别与 LLM 纠错阶段串联成单一流水线提供了可参考的范例。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目