#69 · 主分类: 推理与本地部署
CTranslate2
avx
avx2
cpp
cuda
deep-learning
deep-neural-networks
gemm
inference
intrinsics
machine-translation
mkl
neon
neural-machine-translation
onednn
openmp
opennmt
parallel-computing
quantization
thrust
transformer-models
Transformer模型的快速推理引擎
项目最后更新:08/16/26
GitHub Stars
4.7K
Forks数量
522
贡献者数量
69
许可证
MIT
收录理由
CTranslate2 不依赖常见的深度学习框架,而是用自研的 C++ 引擎配合 Python 接口直接跑 Transformer 模型。它通过层融合、批次重排、去除填充和权重量化等手段,在 CPU 和 GPU 上都比通用框架吞吐更高、内存占用更低。使用时需要先把 Hugging Face Transformers、Fairseq 或 OpenNMT 等工具训练好的模型转换成优化格式,之后通过一个小巧、可预测的 API 加载和生成。对于在资源有限的机器上部署翻译、语音或语言模型服务的团队来说,这个额外步骤通常值得。它支持量化到 4-bit AWQ,且有文档化的向后兼容承诺,长期维护的服务选它会比较稳妥。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。