#160 · 主分类: 推理与本地部署

rwkv.cpp

deep-learning ggml language-model llm machine-learning quantization rwkv

在CPU上对RWKV语言模型进行INT4/INT5/INT8和FP16推理

项目最后更新:03/23/25

GitHub Stars

1.6K

Forks数量

129

贡献者数量

90

许可证

MIT

收录理由

这个项目把RWKV语言模型移植到了ggml运行时上,让没有GPU的机器也能跑起RWKV模型。它提供C库和便捷的Python封装,核心亮点是支持INT4、INT5、INT8和FP16等多种量化格式,能在普通CPU上通过牺牲少量精度来缩小模型文件体积、加快token生成速度。对于在纯CPU或边缘设备上运行RWKV v4到v7的团队,项目附带的转换和量化脚本可以帮你从Hugging Face的检查点一路走到本地可用的模型,同时提供了实测的困惑度和延迟对比表,方便你根据数据挑选合适的量化档位。如果机器上有GPU,它还支持cuBLAS和hipBLAS,可以把部分层卸载到显卡上,无需切换运行时。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目