#111 · 主分类: 基础模型

scibert

bert nlp scientific-papers

一个用于科学文本的BERT模型。

项目最后更新:02/22/22

GitHub Stars

1.7K

Forks数量

232

贡献者数量

6

许可证

Apache-2.0

收录理由

通用BERT模型多在网页文本上预训练,处理日常语言尚可,却往往读不懂科研论文里基因名、化合物这类术语的用法。SciBERT另辟蹊径,从零开始在Semantic Scholar收录的上百万篇全文研究论文上训练,词汇表也是专门为科学写作定制的,而不是照搬通用网页文本。这种领域上的专注,在生物医学命名实体识别、关系抽取、引文意图分类等标准科学信息抽取任务上得到了回报,基准测试成绩相当亮眼。仓库提供了带大小写和不带大小写的检查点,同时配了定制版和原始版BERT词表,预训练权重可以直接通过Hugging Face Transformers API加载,方便你针对自己的文档流程做微调。项目还附带了评测脚本和数据,想先复现报告中的数字,再决定是否把模型用到自己的语料上,会省不少事。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目