#112 · 主分类: 知识库与企业搜索
RAG-Retrieval
统一RAG检索的高效微调,包括Embedding、ColBERT、ReRanker。
项目最后更新:08/28/26
GitHub Stars
1.1K
Forks数量
88
贡献者数量
12
许可证
MIT
收录理由
如果你正在用自有领域数据微调检索流水线,这个项目提供的是一套可直接上手的训练工具箱,而不是又一个只做推理的封装。它覆盖了RAG场景中常见的三类模型——稠密向量模型、ColBERT这类后期交互编码器,以及基于交叉编码器或LLM的重排序模型,都能基于BGE、GTE、BCE等开放检查点进行训练。同时支持知识蒸馏,能把大型LLM重排序器或嵌入模型压缩到0.5B或BERT-base规模,降低部署成本。推理侧则提供了一个轻量级Python库,用统一的接口调用不同的重排序模型,还处理了长文档场景,当语料超出常规上下文长度时也能应对。对于做检索对比研究的人,项目中关于位置偏置的基准测试和MTEB重排序结果,可以作为衡量代码实际效果的参考。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
ragflow
RAGFlow 是一款领先的开源检索增强生成(RAG)引擎,将前沿 RAG 与 Agent 能力融合,为大型语言模型(LLM)打造卓越的上下文层。
Understand-Anything
教学型图表优于炫技型图表。将任意代码转化为可探索、搜索和提问的交互式知识图谱。支持Claude Code、Codex、Cursor、Copilot、Gemini CLI等。
crawl4ai
🚀🤖 Crawl4AI:开源的、对LLM友好的网页爬虫与抓取工具。别害羞,加入这里:https://discord.gg/jP8KfhDhyN
docling
为生成式AI准备文档
anything-llm
停止租用你的智能。用AnythingLLM拥有它。你需要的一切,实现强大的本地优先智能体体验。