#98 · 主分类: 自然语言处理与文本处理

CLUECorpus2020

albert bert chinese chinese-corpus corpus datasets nlp pretrain roberta

大规模中文预训练语料库100G

项目最后更新:02/06/26

GitHub Stars

1.0K

Forks数量

83

贡献者数量

4

许可证

MIT

收录理由

训练中文模型的团队,多半都得自己从原始网页抓取里折腾出一份能用的清洗文本,费时费力。CLUECorpus2020把这一步省掉了:它从Common Crawl的中文部分里筛出大约100GB的高质量语料,直接拿来做预训练就行。另外还附带一个14GB的小型版本CLUECorpusSmall,按新闻、社区、百科、评论等子集分开,方便不同任务取用。项目方还发布了一个精简的中文词表,比Google原版小不少,想压缩tokenizer体积的话很实用。README里给出的BERT-base基线结果,能帮你大致了解不同数据量和词表选择在下游中文任务上会带来什么差异。需要注意的是,大语料库要通过邮箱申请获取,不是直接下载,得提前安排好这个流程。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目