#139 · 主分类: 基础模型

guwenbert

bert classical-chinese guwenbert literary-chinese transformers

GuwenBERT:古文预训练语言模型(古文BERT),一个面向古典中文(文言文)的预训练语言模型

项目最后更新:08/31/21

GitHub Stars

567

Forks数量

41

贡献者数量

1

许可证

Apache-2.0

收录理由

现代自然语言处理模型几乎都围绕当代汉语构建,古文这一语言形态长期缺乏可用的预训练权重。GuwenBERT以RoBERTa为骨架,用超过一万五千部古籍、总计约十七亿字符的语料训练,词表也直接从古文高频字中提取,因此对文言文的用字和句法习惯有更贴合的表示。模型通过Hugging Face Transformers加载,接入微调流程很直接,不需要额外改造。作者在古文命名实体识别任务上报告了比主流中文RoBERTa高6.3%的效果,并且大约三百步训练就能达到后者的最终水平,这对标注数据稀缺的小规模项目尤其有价值。处理史料的断句、标点恢复和专名标注时,它省去了把现代语言模型硬套到另一种语域上的麻烦。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目