#204 · 主分类: 自然语言处理与文本处理

weixin_public_corpus

chinese-nlp corpora corpus linguistics natural-language-processing nlp wei-xin weixin weixin-data yu-liao yu-liao-ku

微信公众号语料库

项目最后更新:01/07/19

GitHub Stars

595

Forks数量

162

贡献者数量

3

许可证

Other

收录理由

做中文自然语言处理的人,这份语料算是个难得的实物:几个GB的真实微信公众号文章,HTML已经剥干净,每行一条JSON,字段里带着公众号名字、ID、标题和正文。这种结构丢进pandas或者直接接文本处理流程都很顺手,拿来训练语言模型、做主题分类或者分析当代中文的情感倾向都挺合适。数据用无密码的zip分卷打包,还附了预览文件,可以先看看内容再决定要不要全量下载。不过要心里有数,它是个研究用的语料集,不是持续维护的工具——清洗工作得自己来,而且这个库从2019年起就没再更新过了。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目