#40 · 主分类: 推理与本地部署
lmdeploy
LMDeploy 是一个用于压缩、部署和服务 LLM 的工具包。
项目最后更新:08/28/26
GitHub Stars
8.0K
Forks数量
733
贡献者数量
152
许可证
Apache-2.0
收录理由
LMDeploy 把大模型从训练走向生产服务所需的环节打包在了一起:TurboMind 推理引擎针对吞吐量做了 CUDA 内核级优化,量化工具支持 4-bit 压缩与面向 MoE 模型的 FP8 精度,还自带 OpenAI 兼容的 API 服务端,已有客户端无需改动即可接入。它能在 NVIDIA GPU 上运行 InternLM、DeepSeek、Qwen 和 Llama 系列模型,文档覆盖了离线批量推理、命令行对话和 REST 服务三种使用方式。项目公布的基准测试结果在同类框架中相当亮眼,与 vLLM 等方案对比时也拿得出手,同时它自己附带了完整的量化流程,拿来当评测标尺或者直接做生产部署都很合适。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。