#117 · 主分类: 自然语言处理与文本处理

pubmed_parser

article doi medline-xml nlp parse parser pmid pubmed-central pubmed-parser python xml

:clipboard: 用于PubMed开放获取XML子集和MEDLINE XML数据集的Python解析器

项目最后更新:07/31/25

GitHub Stars

737

Forks数量

181

贡献者数量

41

许可证

MIT

收录理由

PubMed 的 XML 记录格式繁杂,不同期刊和数据库版本之间差异不小,很多团队都为此重复写过脆弱的解析代码。这个库把这些工作集中做了一遍:它能读取 PubMed 开放获取子集、MEDLINE XML 以及 Entrez E-utils 返回的数据,并转换成普通的 Python 字典,同时提供文章元数据、引用、段落、图片、图注和基金编号等解析器。做文本挖掘、文献计量或生物医学 NLP 的人,可以把精力放在分析本身,而不是纠结于记录格式的细节。代码量不大,读起来不费劲,也方便按需修改;如果内置解析器没有覆盖某个字段,直接扩展即可,不必从零开始。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目