#102 · 主分类: 自然语言处理与文本处理
spacy-layout
📚 使用spaCy处理PDF、Word文档等
项目最后更新:03/27/26
GitHub Stars
910
Forks数量
65
贡献者数量
6
许可证
MIT
收录理由
spacy-layout 是一个专为 spaCy 打造的插件,能把 PDF、Word 文档以及类似格式的文件直接接入现有的自然语言处理流程。它建立在 Docling 之上,将输入文档转换成 spaCy 标准的 Doc 对象,标题、章节、表格和页面布局都会以带标签的文本片段形式呈现,并且这些片段可以精确对应回原文。这样一来,文档内容就能无缝用于分词、命名实体识别或文本分类等任务,省去了手动处理格式转换的麻烦。对于做检索增强生成(RAG)的团队来说,这个插件特别实用:因为章节和表格的结构信息在切块时能够得到保留,你可以把带有完整上下文的有意义片段送入向量库,而不是一整页原始文本。表格数据会被提取为 pandas 的 DataFrame,同时你还可以自定义表格在文档文本中的渲染方式,这让后续的抽取代码变得简洁而可控。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。