#192 · 主分类: 计算机视觉
layout-parser
基于深度学习的文档图像分析统一工具包
项目最后更新:08/15/24
GitHub Stars
5.8K
Forks数量
532
贡献者数量
9
许可证
Apache-2.0
收录理由
把成堆的扫描件变成结构化数据,通常意味着要写一堆针对特定版式的规则,可一旦换一种模板,这些规则就失效了。LayoutParser 走了另一条路:它用一层轻巧的 Python 封装,把预训练好的深度学习检测模型接进来,几行代码就能定位出文本块、图片和表格。同一个接口还能对接 OCR,并且支持对检测出的区域做筛选和重排——比如从双栏页面里单独取出左栏,只需要几次操作,不必再写定制脚本。检测结果可以导出成 JSON、CSV 或 COCO 格式,方便交给下游工具。如果手里的文档和公开数据集差异很大,也可以用自己的页面去微调检测器。对经常处理文档的团队来说,这套工具提供的是一个统一、可组合的工作流,而不是一堆零散模型的拼凑。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。