GitHub Stars
789
Forks数量
86
贡献者数量
1.9K
许可证
MIT
收录理由
跑本地大模型时,长上下文往往最先吃光显存,这个 llama.cpp 分支就专攻这个痛点。它的可变比特率 KV 缓存默认保持 FP16 全精度,只有当显存真的吃紧时才逐层压缩,而不是一开始就固定用 3-bit 或 4-bit 牺牲质量,所以任何时刻你拿到的都是当前显存下最好的缓存质量。码率阶梯里还包含网格编码量化层,能在 2-3 bit 的低比特下挽回不少通常损失掉的精度。由于它直接兼容 llama.cpp 服务器,你现有的 GGUF 模型不用改任何东西就能跑起来,试试 `-ct vbr` 这类参数即可。维护者自己标注为高度实验性,定位是研究级工具,适合做评估和调参,别当稳定生产环境来用。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。