GitHub Stars
1.7K
Forks数量
232
贡献者数量
6
许可证
Apache-2.0
收录理由
通用BERT模型多在网页文本上预训练,处理日常语言尚可,却往往读不懂科研论文里基因名、化合物这类术语的用法。SciBERT另辟蹊径,从零开始在Semantic Scholar收录的上百万篇全文研究论文上训练,词汇表也是专门为科学写作定制的,而不是照搬通用网页文本。这种领域上的专注,在生物医学命名实体识别、关系抽取、引文意图分类等标准科学信息抽取任务上得到了回报,基准测试成绩相当亮眼。仓库提供了带大小写和不带大小写的检查点,同时配了定制版和原始版BERT词表,预训练权重可以直接通过Hugging Face Transformers API加载,方便你针对自己的文档流程做微调。项目还附带了评测脚本和数据,想先复现报告中的数字,再决定是否把模型用到自己的语料上,会省不少事。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。