#167 · 主分类: 推理与本地部署
transformer-deploy
高效、可扩展且企业级的 CPU/GPU 推理服务器,适用于 🤗 Hugging Face 变压器模型 🚀
项目最后更新:10/23/24
GitHub Stars
1.7K
Forks数量
153
贡献者数量
8
许可证
Apache-2.0
收录理由
把 Hugging Face 的 transformer 模型真正跑进线上服务,很多团队都会卡在同一道坎上:checkpoint 在 notebook 里一切正常,可一上线就没人说得清延迟到底是多少。transformer-deploy 就是来填这个坑的——只要模型能导出成 ONNX,一条命令就能生成优化后的推理引擎、完整的目录结构和 Triton 配置,文本分类、token 分类、稠密向量、文本生成都能覆盖。作者自己是在法律领域的语义检索系统里用它的,那个系统每个查询要给几百条片段打分,所以项目里的 benchmark 和默认参数都来自真实的延迟压力,不是拿玩具示例糊弄人。TensorRT 和 ONNX Runtime 的繁琐接线它都替你处理好了,CPU 和 GPU 上的量化也一并搞定,你不需要变成编译专家就能拿到几倍的加速。如果你正在 Triton 和 FastAPI 风格的服务器之间犹豫,项目里的对比表格和基于 Docker 的演示能让你用实测数据做决定,而不是靠拍脑袋猜。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。