#228 · 主分类: 知识库与企业搜索

WEB_KG

baidu baike knowledge-graph neo4j nlp spider wiki

爬取百度百科中文页面,抽取三元组信息,构建中文知识图谱

项目最后更新:07/20/20

GitHub Stars

958

Forks数量

195

贡献者数量

3

许可证

Other

收录理由

从百度百科抓取中文页面,抽取出主语-谓语-宾语的三元组,再存入MongoDB,最后导入Neo4j图数据库,形成一个可以直接浏览的中文知识图谱。整个流程不是零散的脚本拼凑,而是用Scrapy搭起的完整管道,代码量不大,通读一遍就能理清脉络。部署上Linux和Windows都有说明,Windows的注意事项还专门开了issue来补充。解析逻辑针对百度百科的页面结构编写,所以换到别的站点时,抽取部分需要自己调整;但如果你的目标是做中文网页的抓取和图谱构建,这份代码是很合适的参照起点。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目