#165 · 主分类: 计算机视觉
text-extract-api
使用最先进的现代OCR + Ollama支持模型的文档(PDF、Word、PPTX等)提取和解析API。匿名化文档。移除PII。将任何文档或图片转换为结构化JSON或Markdown。
项目最后更新:12/08/25
GitHub Stars
3.2K
Forks数量
278
贡献者数量
12
许可证
MIT
收录理由
如果你经常要把发票、医疗报告或各类办公文档转成干净的结构化数据,这个项目不是那种只能跑通演示的玩具,而是能真正派上用场的工具。它把完整的OCR和解析流程都放在本地跑:EasyOCR和视觉模型负责处理图片与PDF中的复杂内容,接着由Ollama支持的LLM把原始文本整理成Markdown或JSON,甚至能顺手纠正OCR产生的拼写错误。整套环境通过docker-compose交付,不依赖任何云服务,敏感文档从头到尾都不用离开你自己的服务器,而且同一套流程还能在存储前自动抹掉个人身份信息。API基于FastAPI,配合Celery队列和Redis缓存,你可以把大批量文档塞进去处理,并单独扩展worker进程来应对负载。如果你需要一个能自托管、能直接接入现有后端系统的文档转数据接口,这个项目是相当扎实的起点。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。