#124 · 主分类: 知识库与企业搜索
sycamore
🍁 Sycamore 是一个基于 LLM 的搜索和分析平台,用于处理非结构化数据。
项目最后更新:08/01/26
GitHub Stars
607
Forks数量
72
贡献者数量
37
许可证
Apache-2.0
收录理由
Sycamore 填补了原始文档与真正要查询的向量库或检索引擎之间的空白。它是一个开源处理引擎,能把 PDF、演示文稿、会议记录和手册等文件先切分,再经过富化和分块,让结果可以直接载入 OpenSearch、Elasticsearch、Pinecone、Qdrant、Weaviate 或 DuckDB。它的 DocSet 抽象很有意思:你可以用声明式数据流来描述切分、清洗和加载过程,这样尝试不同的分块策略时就不用写一堆胶水代码。你还能自己选择用哪些大语言模型来驱动富化转换。Aryn 的 DocParse 服务和开源的 DETR 视觉模型能处理带表格、图形等复杂版面的页面,让文档的语义结构在分块后依然保留。对于要在杂乱的企业文档上搭建 RAG 或混合搜索的团队来说,这种以 notebook 驱动的工作流和 Ray 后端,能帮你从原型顺利过渡到生产环境。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
ragflow
RAGFlow 是一款领先的开源检索增强生成(RAG)引擎,将前沿 RAG 与 Agent 能力融合,为大型语言模型(LLM)打造卓越的上下文层。
Understand-Anything
教学型图表优于炫技型图表。将任意代码转化为可探索、搜索和提问的交互式知识图谱。支持Claude Code、Codex、Cursor、Copilot、Gemini CLI等。
crawl4ai
🚀🤖 Crawl4AI:开源的、对LLM友好的网页爬虫与抓取工具。别害羞,加入这里:https://discord.gg/jP8KfhDhyN
docling
为生成式AI准备文档
anything-llm
停止租用你的智能。用AnythingLLM拥有它。你需要的一切,实现强大的本地优先智能体体验。