#140 · 主分类: 推理与本地部署

infinity

bert-embeddings llm text-embeddings

Infinity 是一个高吞吐量、低延迟的文本嵌入、重排序模型、clip、clap 和 colpali 的服务引擎。

项目最后更新:03/24/26

GitHub Stars

2.9K

Forks数量

198

贡献者数量

35

许可证

MIT

收录理由

如果你的检索或RAG系统需要自托管向量服务,Infinity 提供了一个开箱即用的 REST 服务,把推理环节的复杂细节都封装好了。它支持文本嵌入、重排序模型,也支持 CLIP、ColPali 这类多模态模型,并且 API 与 OpenAI 兼容,迁移成本很低。底层推理引擎可切换 PyTorch、ONNX/TensorRT 和 CTranslate2,按硬件条件灵活选择,从 NVIDIA、AMD 显卡一路用到纯 CPU 环境都没问题。动态批处理和独立线程里的 tokenization 设计,让高并发下依然能保持不错的吞吐;单个进程还能同时管理多个模型。对于需要低延迟自托管嵌入、重排或视觉语言向量的团队来说,这是一个相当务实的接入方案。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目