#71 · 主分类: 推理与本地部署

text-embeddings-inference

ai embeddings huggingface llm ml

用于文本嵌入模型的极速推理解决方案

项目最后更新:07/24/26

GitHub Stars

5.0K

Forks数量

426

贡献者数量

64

许可证

Apache-2.0

收录理由

把嵌入模型部署到检索或 RAG 场景里,通常得自己把 transformer 库接进 Web 服务,还得担心它在真实流量下扛不扛得住。Text Embeddings Inference(TEI)把这一步省掉了:它直接为 FlagEmbedding、GTE、E5、ModernBERT 这类开源模型提供服务,采用基于 token 的动态批处理,请求处理效率高,无需再手工搭建推理层。项目跳过了模型图编译环节,Docker 镜像小、启动快,既能适应 serverless 部署,也能借助 Metal 在 Mac 上做本地开发。同时支持重排序模型和序列分类模型,并暴露 Prometheus 指标与 OpenTelemetry 追踪,方便在把生产流量切过去之前,先接入你现有的监控体系。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目