GitHub Stars
527
Forks数量
75
贡献者数量
3
许可证
Other
收录理由
如果你们团队正在做针对私有或专业文档的检索增强生成,可能会发现通用嵌入模型经常捕捉不到用户实际输入的那种问法,导致检索效果差强人意。这套notebook提供了一条绕开这个困境的思路:先用LLM为每个文本块生成若干假设性问题,从而自动构造出查询与相关文档的正样本对,省去了人工标注的麻烦;接着在这些样本对上用排序损失微调一个开源嵌入模型,再把它和原始模型以及OpenAI的嵌入模型放在同一批数据上对比检索效果。作者用金融类PDF做了小规模实验,结果显示微调后检索性能提升明显。要注意的是,这份代码已经有些过时,维护者已把相关的微调抽象整合进了LlamaIndex主仓库,所以这个项目更适合当作一种技术路线的学习参考,而不是直接拿来部署的现成工具。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
ragflow
RAGFlow 是一款领先的开源检索增强生成(RAG)引擎,将前沿 RAG 与 Agent 能力融合,为大型语言模型(LLM)打造卓越的上下文层。
Understand-Anything
教学型图表优于炫技型图表。将任意代码转化为可探索、搜索和提问的交互式知识图谱。支持Claude Code、Codex、Cursor、Copilot、Gemini CLI等。
crawl4ai
🚀🤖 Crawl4AI:开源的、对LLM友好的网页爬虫与抓取工具。别害羞,加入这里:https://discord.gg/jP8KfhDhyN
docling
为生成式AI准备文档
anything-llm
停止租用你的智能。用AnythingLLM拥有它。你需要的一切,实现强大的本地优先智能体体验。