#135 · 主分类: 知识库与企业搜索
VLM2Vec
此仓库包含以下论文的代码:"VLM2Vec / MMEB" [ICLR 2025], "VLM2Vec-V2 / MMEB-V2" [TMLR 2026], 和 "MMEB-V3" [COLM 2026]
项目最后更新:08/23/26
GitHub Stars
680
Forks数量
64
贡献者数量
10
许可证
Apache-2.0
收录理由
多模态检索场景里,多数嵌入工具默认只处理文本,而 VLM2Vec 提供了另一条路径:把视觉语言模型改造成稠密检索器,让图片、视频、音频、视觉文档和智能体类查询都能与文本一起参与检索。仓库同时给出训练配方和 MMEB 评测基准,基准已更新到 V3,包含 190 个任务,用来衡量嵌入模型在各类模态指令下的表现。无论你想自己训练模型,还是评估第三方方案,这套工具都能派上用场。其中的 OmniSET 诊断组件还能帮你区分检索失败是模态处理的问题,还是指令跟随的问题。代码偏研究性质,直接上生产前需要自行调整脚本。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
ragflow
RAGFlow 是一款领先的开源检索增强生成(RAG)引擎,将前沿 RAG 与 Agent 能力融合,为大型语言模型(LLM)打造卓越的上下文层。
Understand-Anything
教学型图表优于炫技型图表。将任意代码转化为可探索、搜索和提问的交互式知识图谱。支持Claude Code、Codex、Cursor、Copilot、Gemini CLI等。
crawl4ai
🚀🤖 Crawl4AI:开源的、对LLM友好的网页爬虫与抓取工具。别害羞,加入这里:https://discord.gg/jP8KfhDhyN
docling
为生成式AI准备文档
anything-llm
停止租用你的智能。用AnythingLLM拥有它。你需要的一切,实现强大的本地优先智能体体验。