#181 · 主分类: 深度学习框架

local-attention

artificial-intelligence attention-mechanisms deep-learning

用于语言建模的局部窗口注意力实现

项目最后更新:07/16/25

GitHub Stars

503

Forks数量

49

贡献者数量

3

许可证

MIT

收录理由

长上下文的Transformer里,全量自注意力常常成为性能瓶颈,因为计算量会随序列长度平方级增长。这个库选择了一条务实的路:采用窗口注意力,每个位置只关注设定窗口内的token,还可以额外回看前一个窗口。这样内存和计算开销显著下降,同时语言建模质量依然扎实。作者本人已经把这套代码用在多个稀疏注意力相关的项目里。它就是一个普通的PyTorch模块,能直接嵌入现有训练流程:你决定窗口大小、是否因果,再通过开关控制回看、共享查询/键空间(用于Reformer风格模型)和自动填充。仓库里附带的LocalTransformer包装器也示范了如何把窗口层整合进完整的Transformer堆叠,就算你最终打算自己组装各个部件,这份参考也很有价值。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目