GitHub Stars
3.1K
Forks数量
444
贡献者数量
840
许可证
MIT
收录理由
这是llama.cpp的一个分支,2024年中创建,同年8月与上游同步,重点放在CPU推理速度上,并自带若干额外量化格式,不少情况下比主线构建跑得更快。MLA、张量并行、多token预测、融合delta-net等推理特性,都是先在这里出现,后来才进入llama.cpp本体。项目对自己的边界说得很明白:维护得最好的是CPU(AVX2以上、ARM_NEON)和Turing及以上CUDA后端,ROCm、Vulkan、Metal则几乎无人打理,选型前得先盘算自己的硬件。它提供带OpenAI兼容接口的llama-server可执行文件、Docker镜像,也能跑较新的Qwen、DeepSeek、GLM和LLaMA模型。不过,-rtr重打包开关以及Unsloth那些带f16张量的_XL模型都有坑,真要当drop-in替换用,务必先读README里的警告。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。