#167 · 主分类: 推理与本地部署

transformer-deploy

deep-learning deployment inference machine-learning natural-language-processing server

高效、可扩展且企业级的 CPU/GPU 推理服务器,适用于 🤗 Hugging Face 变压器模型 🚀

项目最后更新:10/23/24

GitHub Stars

1.7K

Forks数量

153

贡献者数量

8

许可证

Apache-2.0

收录理由

把 Hugging Face 的 transformer 模型真正跑进线上服务,很多团队都会卡在同一道坎上:checkpoint 在 notebook 里一切正常,可一上线就没人说得清延迟到底是多少。transformer-deploy 就是来填这个坑的——只要模型能导出成 ONNX,一条命令就能生成优化后的推理引擎、完整的目录结构和 Triton 配置,文本分类、token 分类、稠密向量、文本生成都能覆盖。作者自己是在法律领域的语义检索系统里用它的,那个系统每个查询要给几百条片段打分,所以项目里的 benchmark 和默认参数都来自真实的延迟压力,不是拿玩具示例糊弄人。TensorRT 和 ONNX Runtime 的繁琐接线它都替你处理好了,CPU 和 GPU 上的量化也一并搞定,你不需要变成编译专家就能拿到几倍的加速。如果你正在 Triton 和 FastAPI 风格的服务器之间犹豫,项目里的对比表格和基于 Docker 的演示能让你用实测数据做决定,而不是靠拍脑袋猜。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目