#160 · 主分类: 深度学习框架

ringattention

large-language-models long-context memory-efficient transformers

大上下文注意力

项目最后更新:10/13/25

GitHub Stars

772

Forks数量

52

贡献者数量

5

许可证

Apache-2.0

收录理由

Ring Attention 在论文里看起来简单,实际实现却有不少细节要处理。这个仓库正是《Ring Attention with Blockwise Transformers》和《Blockwise Parallel Transformer》两篇论文所对应的 JAX 实现,把注意力计算和前馈网络都做了分块处理,并让通信与计算重叠进行,因此可训练的上下文长度会随加速器数量线性扩展,而不是被单块芯片的显存卡死。项目通过 pip 安装后,可以直接导入 ringattention 和 blockwise_feedforward 两个函数,仓库里还给出了用 shard_map 做多设备切分的示例,方便接入自己的模型。不过要说明的是,这属于研究代码,使用前需要针对自己的训练流程做适配,不能当作开箱即用的库。如果你正在 TPU 或多 GPU 的 JAX 环境里探索超长上下文模型,这里是最直接的起点。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目