#37 · 主分类: 推理与本地部署

ik_llama.cpp

llama.cpp 的分支,带有额外的 SOTA 量化和改进的性能

项目最后更新:08/28/26

GitHub Stars

3.1K

Forks数量

444

贡献者数量

840

许可证

MIT

收录理由

这是llama.cpp的一个分支,2024年中创建,同年8月与上游同步,重点放在CPU推理速度上,并自带若干额外量化格式,不少情况下比主线构建跑得更快。MLA、张量并行、多token预测、融合delta-net等推理特性,都是先在这里出现,后来才进入llama.cpp本体。项目对自己的边界说得很明白:维护得最好的是CPU(AVX2以上、ARM_NEON)和Turing及以上CUDA后端,ROCm、Vulkan、Metal则几乎无人打理,选型前得先盘算自己的硬件。它提供带OpenAI兼容接口的llama-server可执行文件、Docker镜像,也能跑较新的Qwen、DeepSeek、GLM和LLaMA模型。不过,-rtr重打包开关以及Unsloth那些带f16张量的_XL模型都有坑,真要当drop-in替换用,务必先读README里的警告。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目