#228 · 主分类: 知识库与企业搜索
WEB_KG
爬取百度百科中文页面,抽取三元组信息,构建中文知识图谱
项目最后更新:07/20/20
GitHub Stars
958
Forks数量
195
贡献者数量
3
许可证
Other
收录理由
从百度百科抓取中文页面,抽取出主语-谓语-宾语的三元组,再存入MongoDB,最后导入Neo4j图数据库,形成一个可以直接浏览的中文知识图谱。整个流程不是零散的脚本拼凑,而是用Scrapy搭起的完整管道,代码量不大,通读一遍就能理清脉络。部署上Linux和Windows都有说明,Windows的注意事项还专门开了issue来补充。解析逻辑针对百度百科的页面结构编写,所以换到别的站点时,抽取部分需要自己调整;但如果你的目标是做中文网页的抓取和图谱构建,这份代码是很合适的参照起点。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
ragflow
RAGFlow 是一款领先的开源检索增强生成(RAG)引擎,将前沿 RAG 与 Agent 能力融合,为大型语言模型(LLM)打造卓越的上下文层。
Understand-Anything
教学型图表优于炫技型图表。将任意代码转化为可探索、搜索和提问的交互式知识图谱。支持Claude Code、Codex、Cursor、Copilot、Gemini CLI等。
crawl4ai
🚀🤖 Crawl4AI:开源的、对LLM友好的网页爬虫与抓取工具。别害羞,加入这里:https://discord.gg/jP8KfhDhyN
docling
为生成式AI准备文档
anything-llm
停止租用你的智能。用AnythingLLM拥有它。你需要的一切,实现强大的本地优先智能体体验。