#127 · 主分类: 自然语言处理与文本处理
papermage
支持科学论文NLP和CV研究的库
项目最后更新:11/08/24
GitHub Stars
803
Forks数量
64
贡献者数量
10
许可证
Apache-2.0
收录理由
如果你经常处理科学论文的PDF,想把原始页面变成模型能直接用的结构,papermage能帮你省掉中间那些麻烦事。它把PDF解析成一个统一的Document对象,同时提供多种切分方式:页面、行、词元、句子、章节、图表、表格和公式,而且这些层级之间互相有引用关系,比如从某个句子能跳到它所在的行,从页面能找到对应的标题。这种分层设计让你不用自己写抽取和对齐的代码,因为解析器、栅格化工具和机器学习预测器都共用同一套数据模型。基于recipe的API上手很快,适合用来快速搭建带引用的问答系统、信息抽取或者需要版面感知的科研论文处理流程。不过要提醒一句:这是EMNLP 2023的研究原型,目前维护不活跃,建议把它当作参考实现和数据模型来用,别在生产环境里直接依赖。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。