#35 · 主分类: 推理与本地部署
PowerInfer
large-language-models
llama
llm
llm-inference
local-inference
高速大语言模型本地部署推理服务
项目最后更新:05/11/26
GitHub Stars
9.8K
Forks数量
597
贡献者数量
399
许可证
MIT
收录理由
PowerInfer瞄准的是本地AI部署中一个颇为尴尬的区间:机器只有一块消费级显卡,跑完整服务器方案显得杀鸡用牛刀。它利用激活局部性这一观察——大多数token生成只依赖一小撮始终活跃的“热”神经元,把这些神经元预先加载到GPU上,而那些不常触发的“冷”神经元则交给CPU计算。这样一来,显存压力和CPU与GPU之间的数据搬运都被压得很低,甚至能在单块RTX 4090上以可用速度跑起类似Falcon-40B的模型。用过llama.cpp的人会感到熟悉,多数示例工作流能直接沿用,也支持加载llama.cpp的模型权重。对于硬件有限的本地推理和原型验证,它是个很实在的选择,也适合拿来摆弄稀疏ReLU结构的模型。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。