#155 · 主分类: 语音合成与识别
chaplin
auto-avsr
avsr
llm
ollama
speech-recognition
speech-to-text
vsr
一个实时的无声语音识别工具。
项目最后更新:11/02/25
GitHub Stars
752
Forks数量
90
贡献者数量
1
许可证
MIT
收录理由
Chaplin 通过摄像头读取唇部动作,将无声默念的词语实时转换为文字,并借助本地大模型对识别结果进行纠错,最终把修正后的文本直接输入到光标所在位置。这种视觉语音识别方案为语音转文字提供了另一种思路,适合在安静环境中免手输入、用于无障碍交互实验,或者作为一项有趣的技术演示。它的部署方式比普通应用更偏开发者向:需要下载 Auto-AVSR 模型权重、运行 Ollama 并加载一个小型 Qwen 模型,再通过命令行启动。因此,它更适合习惯自行组装本地组件的开发者,而非期待一键安装的普通用户。由于整个流程都在本地完成,它也为将视觉语音识别与 LLM 纠错阶段串联成单一流水线提供了可参考的范例。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。