#120 · 主分类: 知识库与企业搜索
WeMM-Embedding
WeMM-Embedding 是腾讯微信视觉团队推出的一系列通用多模态嵌入模型,支持多模态理解和检索。
项目最后更新:08/28/26
GitHub Stars
915
Forks数量
61
贡献者数量
3
许可证
Apache-2.0
收录理由
检索混合了截图、产品照片、扫描页面和短视频片段的内容,通常需要为每种类型单独准备编码器。WeMM-Embedding把这些输入统一映射到一个共享向量空间,所以当查询涉及报告里的某张图片时,它既能匹配这张图,也能匹配周围的文字或图文交错的布局,无需额外的处理环节。仓库里同时给出了Transformers和Sentence Transformers的推理示例,还支持通过vLLM和SGLang部署,如果团队已经有一套嵌入服务,接入成本很低。模型提供多种Matryoshka维度,可以在存储、延迟和准确率之间按需取舍,不必绑定一个固定向量长度。基准测试表现不错,但要注意它不支持音频,而且最大版权的checkpoint有数GB大小,所以这个方案更适合已经具备GPU资源、并且确实需要多模态嵌入而不是纯文本嵌入的团队。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
ragflow
RAGFlow 是一款领先的开源检索增强生成(RAG)引擎,将前沿 RAG 与 Agent 能力融合,为大型语言模型(LLM)打造卓越的上下文层。
Understand-Anything
教学型图表优于炫技型图表。将任意代码转化为可探索、搜索和提问的交互式知识图谱。支持Claude Code、Codex、Cursor、Copilot、Gemini CLI等。
crawl4ai
🚀🤖 Crawl4AI:开源的、对LLM友好的网页爬虫与抓取工具。别害羞,加入这里:https://discord.gg/jP8KfhDhyN
docling
为生成式AI准备文档
anything-llm
停止租用你的智能。用AnythingLLM拥有它。你需要的一切,实现强大的本地优先智能体体验。