#40 · 主分类: 推理与本地部署

lmdeploy

codellama cuda-kernels deepspeed fastertransformer internlm llama llama2 llama3 llm llm-inference turbomind

LMDeploy 是一个用于压缩、部署和服务 LLM 的工具包。

项目最后更新:08/28/26

GitHub Stars

8.0K

Forks数量

733

贡献者数量

152

许可证

Apache-2.0

收录理由

LMDeploy 把大模型从训练走向生产服务所需的环节打包在了一起:TurboMind 推理引擎针对吞吐量做了 CUDA 内核级优化,量化工具支持 4-bit 压缩与面向 MoE 模型的 FP8 精度,还自带 OpenAI 兼容的 API 服务端,已有客户端无需改动即可接入。它能在 NVIDIA GPU 上运行 InternLM、DeepSeek、Qwen 和 Llama 系列模型,文档覆盖了离线批量推理、命令行对话和 REST 服务三种使用方式。项目公布的基准测试结果在同类框架中相当亮眼,与 vLLM 等方案对比时也拿得出手,同时它自己附带了完整的量化流程,拿来当评测标尺或者直接做生产部署都很合适。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目