#215 · 主分类: 推理与本地部署
fastT5
⚡ 将T5模型的推理速度提升5倍,并将模型大小减少3倍。
项目最后更新:04/24/23
GitHub Stars
587
Forks数量
75
贡献者数量
5
许可证
Apache-2.0
收录理由
T5 模型能处理不少 NLP 任务,但它的文本生成是逐字推进的,模型越大,速度越慢。fastT5 直接针对这个瓶颈:把预训练的 Hugging Face T5 模型转成 ONNX 格式,做量化,再放到 onnxruntime 上执行,整个过程只需一次函数调用。转换后的模型仍然支持熟悉的 generate() 方法,已有代码不用改动。效果上,模型体积缩小约 3 倍,CPU 上的推理速度最高提升约 5 倍,beam search 也有明显加速。流程可以按需拆开,导出、量化、运行时这几个步骤都能单独控制。它是个专注的工具,不是完整的服务部署平台,适合想在普通硬件上快速获得可量化提速、又不想重新训练模型的团队。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。