#9 · 主分类: 基础模型

RWKV-LM

attention-mechanism chatgpt deep-learning gpt gpt-2 gpt-3 language-model linear-attention lstm pytorch rnn rwkv transformer transformers

RWKV是一种可并行化的RNN,具有transformer级别的LLM性能,提供线性时间、恒定空间和无限上下文长度。

项目最后更新:08/26/26

GitHub Stars

14.7K

Forks数量

1.0K

贡献者数量

6

许可证

Apache-2.0

收录理由

RWKV 在开源大模型里算是个大胆的异类:它主动放弃了当下 Transformer 普遍依赖的注意力机制,改用纯循环网络结构。这意味着随着上下文变长,推理成本不会跟着涨,也省去了 KV-cache 的管理负担。如果你要在有限硬件上处理超长文档或大量并发请求,这个特性会非常实在。这个仓库是 RWKV-7 'Goose' 架构的参考实现,训练代码、CUDA 内核和演示脚本都齐了,想自己训练或微调 RWKV 模型而不是直接加载现成权重的话,这里就是起点。对于在边缘设备或手机上探索 Transformer 替代方案的团队来说,这套架构和常见的 GPT 风格栈确实很不一样。另外,RWKV 是 Linux 基金会旗下的 AI 项目,代码的长期维护也多了一层保障。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目