#63 · 主分类: 推理与本地部署
fastllm
fastllm是后端无依赖的高性能大模型推理库。同时支持张量并行推理稠密模型和混合模式推理MOE模型,任意10G以上显卡即可推理满血DeepSeek。双路9004/9005服务器+单显卡部署DeepSeek满血满精度原版模型,单并发20tps;INT4量化模型单并发30tps,多并发可达60+。
项目最后更新:08/29/26
GitHub Stars
4.9K
Forks数量
485
贡献者数量
66
许可证
Apache-2.0
收录理由
fastllm最引人注目的能力,是让一块显存超过10GB的显卡就能跑起完整的671B DeepSeek模型,办法是把MoE层交给CPU来处理。这个推理库用C++自研算子,运行时完全不依赖PyTorch,既能推理Qwen、Llama这类稠密模型,也支持DeepSeek、Qwen-moe等MoE架构。张量并行支持多卡协作,三卡、五卡这样的奇数组合也没问题;硬件兼容面很宽,老款N卡、通过ROCm支持的AMD显卡,以及多款国产加速器都能用,连旧设备也能跑FP8推理。通过pip安装后,命令行工具提供了聊天、WebUI和OpenAI风格API服务,还带一个终端部署向导。在双路9004/9005服务器加单显卡的配置下,原版DeepSeek单并发能跑到约20 tokens每秒,INT4量化版能到30,多并发时甚至能突破60。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。