#14 · 主分类: 知识库与企业搜索
PageIndex
📑 PageIndex:面向无向量、基于推理的RAG的文档索引
项目最后更新:08/28/26
GitHub Stars
35.4K
Forks数量
3.1K
贡献者数量
15
许可证
MIT
收录理由
PageIndex 在 RAG 的实现路径上另辟蹊径,不依赖向量库和文本切块,而是把文档构建成分层的内存树索引,让大模型直接基于结构进行推理式检索,省去了调相似度阈值和分块大小的麻烦。它作为自托管 Python 包,能把 PDF 或 Markdown 转成这种索引,还支持用 LLM 生成节点摘要;对于复杂 PDF 的 OCR 等重活,官方也提供了托管聊天平台、MCP 和 API 接口。项目附带了可运行的 agentic RAG 示例,以及面向百万级文档的树状文件系统层,从单份报告到整个语料库都能覆盖。如果你在处理金融或技术类长文档时,向量检索总是抓不到关键上下文,这个项目值得认真看看。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
ragflow
RAGFlow 是一款领先的开源检索增强生成(RAG)引擎,将前沿 RAG 与 Agent 能力融合,为大型语言模型(LLM)打造卓越的上下文层。
Understand-Anything
教学型图表优于炫技型图表。将任意代码转化为可探索、搜索和提问的交互式知识图谱。支持Claude Code、Codex、Cursor、Copilot、Gemini CLI等。
crawl4ai
🚀🤖 Crawl4AI:开源的、对LLM友好的网页爬虫与抓取工具。别害羞,加入这里:https://discord.gg/jP8KfhDhyN
docling
为生成式AI准备文档
anything-llm
停止租用你的智能。用AnythingLLM拥有它。你需要的一切,实现强大的本地优先智能体体验。