#11 · 主分类: 推理与本地部署

airllm

chinese-llm chinese-nlp finetune generative-ai instruct-gpt instruction-set llama llm lora open-models open-source open-source-models qlora

AirLLM 70B 推理,单张4GB GPU

项目最后更新:08/29/26

GitHub Stars

33.1K

Forks数量

3.5K

贡献者数量

10

许可证

Apache-2.0

收录理由

跑一个700亿参数的大模型,通常意味着要租一块昂贵的显卡。AirLLM换了个思路:它把推理时的显存占用压到极低,让同样的模型能在一块4GB显卡上跑起来,而且全程不做量化、蒸馏或剪枝,权重保持原样。这套办法还能往上扩展。像DeepSeek-V3、Kimi K3这类稀疏MoE模型,它按专家逐个加载,而不是整层读入,所以2.8T参数的模型能在不到4GB显存里运行,Llama 3.1 405B也只需8GB。对想在自己手头硬件上尝试前沿开源模型的开发者和小团队来说,这确实搬开了一块大石头。不过要清楚,它是个推理库,不是完整的服务框架,接入自己的流水线还得自己动手。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目