#8 · 主分类: 自然语言处理与文本处理

nlp_chinese_corpus

bert chinese chinese-corpus chinese-dataset chinese-nlp corpus dataset language-model news nlp pretrain question-answering text-classification wiki word2vec

大规模中文自然语言处理语料

项目最后更新:02/06/26

GitHub Stars

9.9K

Forks数量

1.6K

贡献者数量

2

许可证

MIT

收录理由

获取能直接用来训练的中文文本,长期是件麻烦事。这个仓库把几份规模不小的数据集集中在一起,统一整理成JSON格式,下载后就能直接使用。里面包括超过一百万条结构化的维基百科词条、约二百五十万篇带标题和关键词的新闻文章、来自百科和社区问答平台的问答集合,以及数百万对中英互译句子。这些内容基本覆盖了预训练语言模型、构建词向量、训练问答和分类系统时常用的语料类型,省去了几周时间自行爬取和清洗的功夫。作者当初就是为了找一份足够大的中文语料,搜来搜去只看到规模小、版本旧或格式别扭的数据,才动手整理了这个项目——它的价值不只是量大,更在于省事。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目