#71 · 主分类: 推理与本地部署
text-embeddings-inference
用于文本嵌入模型的极速推理解决方案
项目最后更新:07/24/26
GitHub Stars
5.0K
Forks数量
426
贡献者数量
64
许可证
Apache-2.0
收录理由
把嵌入模型部署到检索或 RAG 场景里,通常得自己把 transformer 库接进 Web 服务,还得担心它在真实流量下扛不扛得住。Text Embeddings Inference(TEI)把这一步省掉了:它直接为 FlagEmbedding、GTE、E5、ModernBERT 这类开源模型提供服务,采用基于 token 的动态批处理,请求处理效率高,无需再手工搭建推理层。项目跳过了模型图编译环节,Docker 镜像小、启动快,既能适应 serverless 部署,也能借助 Metal 在 Mac 上做本地开发。同时支持重排序模型和序列分类模型,并暴露 Prometheus 指标与 OpenTelemetry 追踪,方便在把生产流量切过去之前,先接入你现有的监控体系。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。