#16 · 主分类: 自然语言处理与文本处理

Parsr

data document extraction hacktoberfest images nlp ocr parsr pdf python typescript

将PDF、文档和图像转换为富结构化数据

项目最后更新:03/20/26

GitHub Stars

6.2K

Forks数量

318

贡献者数量

30

许可证

Apache-2.0

收录理由

Parsr 能把 PDF、扫描图片、Word 文档和 EML 邮件转换成 JSON、Markdown、CSV 或 TXT 这类结构化数据。它不只是做 OCR,还会先清理文档、重建版面层级,识别出单词、行、段落,并标出标题、表格、列表、页码、页眉页脚等信息,让下游流程拿到的是规整的数据而不是杂乱的识别文本。对文档自动化、归档、数据录入这类场景挺有用,而且提供 Docker 镜像,自带一个界面,上手很快。不过要注意,这个项目已经停止维护,安全补丁也不再更新,更适合当作参考实现或学习素材,别把它作为长期依赖来用。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目