#210 · 主分类: 计算机视觉

Ollama-OCR

使用Ollama视觉语言模型从图像和PDF中提取文本的OCR包,支持多种模型、输出格式和批量处理。

项目最后更新:03/17/25

GitHub Stars

2.8K

Forks数量

323

贡献者数量

4

许可证

MIT

收录理由

从图片和PDF里提取文字,通常要么部署专门的OCR引擎,要么自己写一大堆胶水代码。这个包直接把文件交给通过Ollama在本地运行的视觉语言模型,省掉了那些麻烦。你可以在LLaVA、Llama 3.2 Vision、Moondream等模型之间切换,调用代码完全不用改。它输出的不只是纯文本,还能生成Markdown、JSON、键值对和表格数据,用来把发票和表单数字化很顺手。批量处理自带进度跟踪,自定义提示词也能覆盖常见的自动化场景。自带的Streamlit界面让不熟悉技术的人也能拖拽文件来运行同样的功能。不同模型的准确率有差异,处理重要文档前最好先用小模型试试效果,确认输出靠谱再正式用。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目