#8 · 主分类: 自然语言处理与文本处理
nlp_chinese_corpus
bert
chinese
chinese-corpus
chinese-dataset
chinese-nlp
corpus
dataset
language-model
news
nlp
pretrain
question-answering
text-classification
wiki
word2vec
大规模中文自然语言处理语料
项目最后更新:02/06/26
GitHub Stars
9.9K
Forks数量
1.6K
贡献者数量
2
许可证
MIT
收录理由
获取能直接用来训练的中文文本,长期是件麻烦事。这个仓库把几份规模不小的数据集集中在一起,统一整理成JSON格式,下载后就能直接使用。里面包括超过一百万条结构化的维基百科词条、约二百五十万篇带标题和关键词的新闻文章、来自百科和社区问答平台的问答集合,以及数百万对中英互译句子。这些内容基本覆盖了预训练语言模型、构建词向量、训练问答和分类系统时常用的语料类型,省去了几周时间自行爬取和清洗的功夫。作者当初就是为了找一份足够大的中文语料,搜来搜去只看到规模小、版本旧或格式别扭的数据,才动手整理了这个项目——它的价值不只是量大,更在于省事。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。