#204 · 主分类: 自然语言处理与文本处理
weixin_public_corpus
chinese-nlp
corpora
corpus
linguistics
natural-language-processing
nlp
wei-xin
weixin
weixin-data
yu-liao
yu-liao-ku
微信公众号语料库
项目最后更新:01/07/19
GitHub Stars
595
Forks数量
162
贡献者数量
3
许可证
Other
收录理由
做中文自然语言处理的人,这份语料算是个难得的实物:几个GB的真实微信公众号文章,HTML已经剥干净,每行一条JSON,字段里带着公众号名字、ID、标题和正文。这种结构丢进pandas或者直接接文本处理流程都很顺手,拿来训练语言模型、做主题分类或者分析当代中文的情感倾向都挺合适。数据用无密码的zip分卷打包,还附了预览文件,可以先看看内容再决定要不要全量下载。不过要心里有数,它是个研究用的语料集,不是持续维护的工具——清洗工作得自己来,而且这个库从2019年起就没再更新过了。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。