#9 · 主分类: 基础模型
RWKV-LM
RWKV是一种可并行化的RNN,具有transformer级别的LLM性能,提供线性时间、恒定空间和无限上下文长度。
项目最后更新:08/26/26
GitHub Stars
14.7K
Forks数量
1.0K
贡献者数量
6
许可证
Apache-2.0
收录理由
RWKV 在开源大模型里算是个大胆的异类:它主动放弃了当下 Transformer 普遍依赖的注意力机制,改用纯循环网络结构。这意味着随着上下文变长,推理成本不会跟着涨,也省去了 KV-cache 的管理负担。如果你要在有限硬件上处理超长文档或大量并发请求,这个特性会非常实在。这个仓库是 RWKV-7 'Goose' 架构的参考实现,训练代码、CUDA 内核和演示脚本都齐了,想自己训练或微调 RWKV 模型而不是直接加载现成权重的话,这里就是起点。对于在边缘设备或手机上探索 Transformer 替代方案的团队来说,这套架构和常见的 GPT 风格栈确实很不一样。另外,RWKV 是 Linux 基金会旗下的 AI 项目,代码的长期维护也多了一层保障。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。