#158 · 主分类: 推理与本地部署

TurboTransformers

albert bert decoder gpt2 gpu huggingface-transformers inference machine-translation nlp pytorch roberta transformer

一个快速且易于使用的Transformer推理运行时,支持CPU和GPU,适用于Bert、Albert、GPT2、解码器等模型。

项目最后更新:07/18/25

GitHub Stars

1.5K

Forks数量

208

贡献者数量

16

许可证

Other

收录理由

TurboTransformers 出自腾讯微信 AI 团队,已经在公司内部的线上 BERT 服务中实际运行,其宣称的加速效果来自真实生产负载,而非仅仅依赖基准测试。它支持 BERT、ALBERT、RoBERTa 以及 GPT-2 风格的编码器和解码器,覆盖 CPU 与 GPU 环境,并且可以作为一个轻量插件接入现有 PyTorch 代码,无需重写推理服务路径。变长输入不需要离线图预处理,运行时可以随时调整 batch size 和序列长度;智能批处理还能在请求长度不一的情况下降低零填充开销。腾讯在生产环境中的实测数据包括:微信 FAQ 匹配提速 1.88 倍,公有云情感分析提速 2.11 倍,QQ 推荐系统提速 13.6 倍。同时提供 Python 和 C++ API,方便在非 Python 技术栈中嵌入推理能力。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目