#69 · 主分类: 推理与本地部署

CTranslate2

avx avx2 cpp cuda deep-learning deep-neural-networks gemm inference intrinsics machine-translation mkl neon neural-machine-translation onednn openmp opennmt parallel-computing quantization thrust transformer-models

Transformer模型的快速推理引擎

项目最后更新:08/16/26

GitHub Stars

4.7K

Forks数量

522

贡献者数量

69

许可证

MIT

收录理由

CTranslate2 不依赖常见的深度学习框架,而是用自研的 C++ 引擎配合 Python 接口直接跑 Transformer 模型。它通过层融合、批次重排、去除填充和权重量化等手段,在 CPU 和 GPU 上都比通用框架吞吐更高、内存占用更低。使用时需要先把 Hugging Face Transformers、Fairseq 或 OpenNMT 等工具训练好的模型转换成优化格式,之后通过一个小巧、可预测的 API 加载和生成。对于在资源有限的机器上部署翻译、语音或语言模型服务的团队来说,这个额外步骤通常值得。它支持量化到 4-bit AWQ,且有文档化的向后兼容承诺,长期维护的服务选它会比较稳妥。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目