#122 · 主分类: 自然语言处理与文本处理

weibo_terminater

chatbot chinese corpus scraper sina weibo

终极微博爬虫,从微博抓取任何内容,评论、微博内容、粉丝等一切。终结者。

项目最后更新:10/25/19

GitHub Stars

2.3K

Forks数量

450

贡献者数量

6

许可证

Other

收录理由

做中文对话模型的人都会撞上同一堵墙:干净又大规模的真实语料实在太难找。这个爬虫能抓取微博公开的帖子、评论和关注者信息,让你自己攒语料,不用去花钱买或者费劲从别的封闭源里挖。它最特别的地方是有一段脚本,能把评论区里的你来我往抽成对话对,这正是拿来训练聊天机器人最需要的形态,而不是一堆没法直接用的原始文本。爬虫还支持多账号轮换,绕开访问频率限制,也支持断点续爬,跑长任务时省心不少。作者在说明里明确讲这东西只供学术研究,代码自2019年后也没再动过,所以别把它当成还在维护的服务,当一套值得借鉴的技术方案和原材料看更合适。想要中文对话数据的人,即便最后要重写抓取那层,回复对提取和防封号的思路也够研究一阵。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目