#19 · 主分类: 自然语言处理与文本处理

grobid

bibliographical-references crf deep-learning fulltext hamburger-to-cow machine-learning metadata pdf rnn scientific-articles transformers

用于从学术文档中提取信息的机器学习软件

项目最后更新:08/29/26

GitHub Stars

5.1K

Forks数量

568

贡献者数量

75

许可证

Apache-2.0

收录理由

GROBID 专门处理学术 PDF 这类格式混乱的文档,借助训练好的模型自动识别标题、摘要、作者、参考文献列表、引用上下文、正文段落、图表等元素,并把它们整理成结构清晰的 TEI/XML 输出,省去手工清洗文本的麻烦。很多学术搜索引擎、引文数据库和文献知识图谱项目正是依赖这种结构化结果来构建自己的数据管道。这个项目从 2011 年起就以开源形式持续维护,已被多家知名研究平台用于生产环境。它提供 Web 服务接口、Docker 镜像和批处理模式,既能满足小规模集成,也能扛住大规模文献摄入。如果你处理的文献类型比较特殊,还可以利用自带的训练和评测框架对模型进行针对性调优。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目