GitHub Stars
2.8K
Forks数量
323
贡献者数量
4
许可证
MIT
收录理由
从图片和PDF里提取文字,通常要么部署专门的OCR引擎,要么自己写一大堆胶水代码。这个包直接把文件交给通过Ollama在本地运行的视觉语言模型,省掉了那些麻烦。你可以在LLaVA、Llama 3.2 Vision、Moondream等模型之间切换,调用代码完全不用改。它输出的不只是纯文本,还能生成Markdown、JSON、键值对和表格数据,用来把发票和表单数字化很顺手。批量处理自带进度跟踪,自定义提示词也能覆盖常见的自动化场景。自带的Streamlit界面让不熟悉技术的人也能拖拽文件来运行同样的功能。不同模型的准确率有差异,处理重要文档前最好先用小模型试试效果,确认输出靠谱再正式用。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。