#202 · 主分类: 计算机视觉

UForm

bert clip clustering contrastive-learning cross-attention huggingface-transformers image-search language-vision llava multi-lingual multimodal neural-network openai openclip pretrained-models pytorch representation-learning semantic-search transformer vector-search

袖珍型多模态AI,用于跨多语言文本、图像和🔜视频的内容理解与生成,速度比OpenAI CLIP和LLaVA快多达5倍 🖼️ & 🖋️

项目最后更新:10/30/25

GitHub Stars

1.2K

Forks数量

78

贡献者数量

24

许可证

Apache-2.0

收录理由

做多模态检索时,常常要在模型体积和效果之间做取舍,UForm 试图绕开这个难题。它的编码器模型能生成 64 到 768 维的 Matryoshka 式向量,支持短文本和图片,视频也已在规划中,这让向量搜索在普通硬件上也能跑得又快又省。配套的 10 亿参数对话模型擅长看图写描述和回答视觉问题,想给应用加个轻量的图像助手,不必再部署庞大的 LLaVA 服务。更省心的是,同一套模型可以直接导出成 ONNX 和 CoreML,从服务器换到手机端也不用重写代码。对需要做视觉目录或跨语言商品检索的团队来说,这是比常见 CLIP 模型更实用的选择。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目