#215 · 主分类: 深度学习框架

LongNet

artificial-intelligence attention attention-is-all-you-need attention-mechanisms chatgpt context-length gpt3 gpt4 machine-learning transformer

实现自论文《LongNet: Scaling Transformers to 1,000,000,000 Tokens》中的即插即用注意力机制

项目最后更新:01/07/24

GitHub Stars

726

Forks数量

59

贡献者数量

2

许可证

Apache-2.0

收录理由

处理超长输入时,标准Transformer的注意力计算量会随序列长度呈平方级增长,训练往往因此卡住。LongNet把论文中提出的膨胀注意力机制用PyTorch实现出来,让注意力覆盖范围随token距离增大而指数扩展,计算开销却大致保持线性,能应对远超常规自注意力承受能力的序列长度。项目提供了一个独立的DilatedAttention模块,可以直接嵌入现有模型,也附带一个由前馈、层归一化和SwiGLU块搭好的LongNetTransformer,以及针对enwiki8的训练脚本。它更像研究用的积木,而不是开箱即用的成品,想用的话需要按自己的架构调整。如果你在探索极长上下文或文档级序列的实验,这份代码是值得研读和改写的参考。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目