#160 · 主分类: 推理与本地部署
rwkv.cpp
在CPU上对RWKV语言模型进行INT4/INT5/INT8和FP16推理
项目最后更新:03/23/25
GitHub Stars
1.6K
Forks数量
129
贡献者数量
90
许可证
MIT
收录理由
这个项目把RWKV语言模型移植到了ggml运行时上,让没有GPU的机器也能跑起RWKV模型。它提供C库和便捷的Python封装,核心亮点是支持INT4、INT5、INT8和FP16等多种量化格式,能在普通CPU上通过牺牲少量精度来缩小模型文件体积、加快token生成速度。对于在纯CPU或边缘设备上运行RWKV v4到v7的团队,项目附带的转换和量化脚本可以帮你从Hugging Face的检查点一路走到本地可用的模型,同时提供了实测的困惑度和延迟对比表,方便你根据数据挑选合适的量化档位。如果机器上有GPU,它还支持cuBLAS和hipBLAS,可以把部分层卸载到显卡上,无需切换运行时。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。