#57 · 主分类: 自然语言处理与文本处理

scispacy

bioinformatics biomedical custom-pipes nlp scientific-documents spacy

用于科学/生物医学文档的完整spaCy管道和模型。

项目最后更新:12/04/25

GitHub Stars

2.0K

Forks数量

257

贡献者数量

40

许可证

Apache-2.0

收录理由

scispaCy 专为科研论文、临床记录及其他生物医学文本的文本挖掘而设计。通用 spaCy 模型面对密集的医学术语时常力不从心,因此该项目在 spaCy 规则分词器之上增加了定制分词器,并提供了基于生物医学语料训练的词性标注、句法分析和实体跨度检测模型。模型加载方式与标准 spaCy 一致,已有流程几乎无需改动即可接入。针对 CRAFT、JNLPBA、BC5CDR 和 BIONLP13CG 语料训练出的独立命名实体识别模型,能够识别基因、化学物质和疾病提及;缩写检测器和 UMLS 实体链接器等附加组件则帮助处理科学写作中较为杂乱的部分。从轻量到重量级,再到基于 SciBERT 的版本,用户可以根据实际场景在速度与精度之间取舍——无论是批量处理数百万篇摘要,还是运行实时标注服务。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目