#117 · 主分类: 自然语言处理与文本处理
pubmed_parser
:clipboard: 用于PubMed开放获取XML子集和MEDLINE XML数据集的Python解析器
项目最后更新:07/31/25
GitHub Stars
737
Forks数量
181
贡献者数量
41
许可证
MIT
收录理由
PubMed 的 XML 记录格式繁杂,不同期刊和数据库版本之间差异不小,很多团队都为此重复写过脆弱的解析代码。这个库把这些工作集中做了一遍:它能读取 PubMed 开放获取子集、MEDLINE XML 以及 Entrez E-utils 返回的数据,并转换成普通的 Python 字典,同时提供文章元数据、引用、段落、图片、图注和基金编号等解析器。做文本挖掘、文献计量或生物医学 NLP 的人,可以把精力放在分析本身,而不是纠结于记录格式的细节。代码量不大,读起来不费劲,也方便按需修改;如果内置解析器没有覆盖某个字段,直接扩展即可,不必从零开始。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。