#158 · 主分类: 推理与本地部署
TurboTransformers
一个快速且易于使用的Transformer推理运行时,支持CPU和GPU,适用于Bert、Albert、GPT2、解码器等模型。
项目最后更新:07/18/25
GitHub Stars
1.5K
Forks数量
208
贡献者数量
16
许可证
Other
收录理由
TurboTransformers 出自腾讯微信 AI 团队,已经在公司内部的线上 BERT 服务中实际运行,其宣称的加速效果来自真实生产负载,而非仅仅依赖基准测试。它支持 BERT、ALBERT、RoBERTa 以及 GPT-2 风格的编码器和解码器,覆盖 CPU 与 GPU 环境,并且可以作为一个轻量插件接入现有 PyTorch 代码,无需重写推理服务路径。变长输入不需要离线图预处理,运行时可以随时调整 batch size 和序列长度;智能批处理还能在请求长度不一的情况下降低零填充开销。腾讯在生产环境中的实测数据包括:微信 FAQ 匹配提速 1.88 倍,公有云情感分析提速 2.11 倍,QQ 推荐系统提速 13.6 倍。同时提供 Python 和 C++ API,方便在非 Python 技术栈中嵌入推理能力。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。