#16 · 主分类: 自然语言处理与文本处理
Parsr
data
document
extraction
hacktoberfest
images
nlp
ocr
parsr
pdf
python
typescript
将PDF、文档和图像转换为富结构化数据
项目最后更新:03/20/26
GitHub Stars
6.2K
Forks数量
318
贡献者数量
30
许可证
Apache-2.0
收录理由
Parsr 能把 PDF、扫描图片、Word 文档和 EML 邮件转换成 JSON、Markdown、CSV 或 TXT 这类结构化数据。它不只是做 OCR,还会先清理文档、重建版面层级,识别出单词、行、段落,并标出标题、表格、列表、页码、页眉页脚等信息,让下游流程拿到的是规整的数据而不是杂乱的识别文本。对文档自动化、归档、数据录入这类场景挺有用,而且提供 Docker 镜像,自带一个界面,上手很快。不过要注意,这个项目已经停止维护,安全补丁也不再更新,更适合当作参考实现或学习素材,别把它作为长期依赖来用。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。