#27 · 主分类: 计算机视觉

olmocr

用于LLM数据集/训练的PDF线性化工具包

项目最后更新:03/25/26

GitHub Stars

19.4K

Forks数量

1.6K

贡献者数量

16

许可证

Apache-2.0

收录理由

把PDF喂给大模型训练管线,最头疼的往往不是识别本身,而是版面:扫描件里埋着正文、多栏排版打乱顺序、页眉页脚反复出现。olmOCR 在自备 GPU 上跑一个 7B 参数的视觉语言模型,把 PDF、PNG、JPEG 转成干净的 Markdown,遇到图表、表格、公式、手写内容也能维持自然的阅读顺序,同时自动去掉页眉页脚。它不按调用次数收费,百万页的转换成本大约在 200 美元以内,所以批量处理——比如搭建训练语料库、把旧档案数字化——在预算上完全可行。项目还附带一个包含数千份文档的基准测试集,切换工具前可以先拿它和其他 OCR 方案对比效果。对于需要大量干净文档文本、又不想按页付费的团队,这是个很实在的自托管选择。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目