#139 · 主分类: 基础模型
guwenbert
GuwenBERT:古文预训练语言模型(古文BERT),一个面向古典中文(文言文)的预训练语言模型
项目最后更新:08/31/21
GitHub Stars
567
Forks数量
41
贡献者数量
1
许可证
Apache-2.0
收录理由
现代自然语言处理模型几乎都围绕当代汉语构建,古文这一语言形态长期缺乏可用的预训练权重。GuwenBERT以RoBERTa为骨架,用超过一万五千部古籍、总计约十七亿字符的语料训练,词表也直接从古文高频字中提取,因此对文言文的用字和句法习惯有更贴合的表示。模型通过Hugging Face Transformers加载,接入微调流程很直接,不需要额外改造。作者在古文命名实体识别任务上报告了比主流中文RoBERTa高6.3%的效果,并且大约三百步训练就能达到后者的最终水平,这对标注数据稀缺的小规模项目尤其有价值。处理史料的断句、标点恢复和专名标注时,它省去了把现代语言模型硬套到另一种语域上的麻烦。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。