GitHub Stars
19.3K
Forks数量
1.5K
贡献者数量
129
许可证
Apache-2.0
收录理由
KTransformers 解决的是很多人在自己机器上跑大型混合专家模型时都会撞上的难题:模型权重根本塞不进显存。它的思路是把计算拆到 CPU 和 GPU 两头,让真正用到的专家留在加速卡上,其余部分挪进系统内存,这样一来,原本需要好几块高端显卡才能带动的模型,用一张消费级显卡就能跑起来。项目自带针对 AMX/AVX 指令集优化的 CPU 内核,支持 INT4/INT8 量化,还能接入 SGLang 做服务部署,并且提供了一条基于 LLaMA-Factory 的微调路径,让显存有限的用户也能对 MoE 模型做精调。另外,它往往是最早适配 DeepSeek、Kimi、GLM 等新发布开源模型的那批项目,配套教程和基准数据也把实际性能取舍讲得比较清楚。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。