#202 · 主分类: 计算机视觉
UForm
袖珍型多模态AI,用于跨多语言文本、图像和🔜视频的内容理解与生成,速度比OpenAI CLIP和LLaVA快多达5倍 🖼️ & 🖋️
项目最后更新:10/30/25
GitHub Stars
1.2K
Forks数量
78
贡献者数量
24
许可证
Apache-2.0
收录理由
做多模态检索时,常常要在模型体积和效果之间做取舍,UForm 试图绕开这个难题。它的编码器模型能生成 64 到 768 维的 Matryoshka 式向量,支持短文本和图片,视频也已在规划中,这让向量搜索在普通硬件上也能跑得又快又省。配套的 10 亿参数对话模型擅长看图写描述和回答视觉问题,想给应用加个轻量的图像助手,不必再部署庞大的 LLaVA 服务。更省心的是,同一套模型可以直接导出成 ONNX 和 CoreML,从服务器换到手机端也不用重写代码。对需要做视觉目录或跨语言商品检索的团队来说,这是比常见 CLIP 模型更实用的选择。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。