#23 · 主分类: 推理与本地部署

buun-llama-cpp

实验性 llama.cpp 分支,用于推理研究和开发

项目最后更新:08/28/26

GitHub Stars

789

Forks数量

86

贡献者数量

1.9K

许可证

MIT

收录理由

跑本地大模型时,长上下文往往最先吃光显存,这个 llama.cpp 分支就专攻这个痛点。它的可变比特率 KV 缓存默认保持 FP16 全精度,只有当显存真的吃紧时才逐层压缩,而不是一开始就固定用 3-bit 或 4-bit 牺牲质量,所以任何时刻你拿到的都是当前显存下最好的缓存质量。码率阶梯里还包含网格编码量化层,能在 2-3 bit 的低比特下挽回不少通常损失掉的精度。由于它直接兼容 llama.cpp 服务器,你现有的 GGUF 模型不用改任何东西就能跑起来,试试 `-ct vbr` 这类参数即可。维护者自己标注为高度实验性,定位是研究级工具,适合做评估和调参,别当稳定生产环境来用。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目