#145 · 主分类: 知识库与企业搜索
swiss_army_llama
一个基于FastAPI的语义文本搜索服务,利用预计算嵌入和高级相似度度量,并通过textract内置支持多种文件类型。
项目最后更新:02/27/25
GitHub Stars
1.1K
Forks数量
66
贡献者数量
3
许可证
Other
收录理由
这个项目把本地语义搜索这件事做得相当实用:文档和向量都留在自己的机器上,不必依赖外部服务。它用 FastAPI 把 llama.cpp 支持的嵌入模型封装成 REST 接口,能直接吃进 PDF(包括需要 OCR 的扫描件)、Word 文档,甚至音频文件也能先用 Whisper 转成文字再计算嵌入。算好的向量会存进 SQLite,下次遇到相同内容就直接取用,省去重复计算。检索部分基于 FAISS,当普通的余弦相似度不够精细时,还可以用 Kendall tau、Hoeffding's D 这类统计指标做二次筛选,让结果更有区分度。配套的 Swagger 界面和简单的 Docker 配置,让一个小团队也能快速搭起内部搜索工具,不用费太多集成功夫。代码本身也把文档导入、嵌入池化和向量检索的衔接讲得很清楚,适合当作参考来学习。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
ragflow
RAGFlow 是一款领先的开源检索增强生成(RAG)引擎,将前沿 RAG 与 Agent 能力融合,为大型语言模型(LLM)打造卓越的上下文层。
Understand-Anything
教学型图表优于炫技型图表。将任意代码转化为可探索、搜索和提问的交互式知识图谱。支持Claude Code、Codex、Cursor、Copilot、Gemini CLI等。
crawl4ai
🚀🤖 Crawl4AI:开源的、对LLM友好的网页爬虫与抓取工具。别害羞,加入这里:https://discord.gg/jP8KfhDhyN
docling
为生成式AI准备文档
anything-llm
停止租用你的智能。用AnythingLLM拥有它。你需要的一切,实现强大的本地优先智能体体验。