#11 · 主分类: 推理与本地部署
airllm
chinese-llm
chinese-nlp
finetune
generative-ai
instruct-gpt
instruction-set
llama
llm
lora
open-models
open-source
open-source-models
qlora
AirLLM 70B 推理,单张4GB GPU
项目最后更新:08/29/26
GitHub Stars
33.1K
Forks数量
3.5K
贡献者数量
10
许可证
Apache-2.0
收录理由
跑一个700亿参数的大模型,通常意味着要租一块昂贵的显卡。AirLLM换了个思路:它把推理时的显存占用压到极低,让同样的模型能在一块4GB显卡上跑起来,而且全程不做量化、蒸馏或剪枝,权重保持原样。这套办法还能往上扩展。像DeepSeek-V3、Kimi K3这类稀疏MoE模型,它按专家逐个加载,而不是整层读入,所以2.8T参数的模型能在不到4GB显存里运行,Llama 3.1 405B也只需8GB。对想在自己手头硬件上尝试前沿开源模型的开发者和小团队来说,这确实搬开了一块大石头。不过要清楚,它是个推理库,不是完整的服务框架,接入自己的流水线还得自己动手。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。