#159 · 主分类: 知识库与企业搜索
byaldi
只需几行代码即可使用诸如ColPali之类的后期交互多模态模型。
项目最后更新:01/28/25
GitHub Stars
852
Forks数量
91
贡献者数量
11
许可证
Apache-2.0
收录理由
Byaldi 面向需要在扫描件、PDF 或没有可靠文本层的图片里查找内容的用户。它完全绕开 OCR,而是用 ColPali、ColQwen2 这类晚期交互模型把整页文档当作图像来建索引,再通过一个简洁熟悉的接口返回与查询匹配的页面。加载预训练模型、从文件夹构建索引、检索相关页,甚至往已有索引里追加文档,都只需几次方法调用就能完成。如果你想在投入更重的 RAG 架构之前,先在自己手头的资料上快速试一下视觉检索,这个库提供了很轻便的路径。需要留意的是,它目前仍是预发布版本,索引未做压缩,编码文档时也建议配备 GPU,所以更适合当作原型验证工具,而非可直接上生产的调优方案。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
ragflow
RAGFlow 是一款领先的开源检索增强生成(RAG)引擎,将前沿 RAG 与 Agent 能力融合,为大型语言模型(LLM)打造卓越的上下文层。
Understand-Anything
教学型图表优于炫技型图表。将任意代码转化为可探索、搜索和提问的交互式知识图谱。支持Claude Code、Codex、Cursor、Copilot、Gemini CLI等。
crawl4ai
🚀🤖 Crawl4AI:开源的、对LLM友好的网页爬虫与抓取工具。别害羞,加入这里:https://discord.gg/jP8KfhDhyN
docling
为生成式AI准备文档
anything-llm
停止租用你的智能。用AnythingLLM拥有它。你需要的一切,实现强大的本地优先智能体体验。