#194 · 主分类: 深度学习框架

linear-attention-transformer

artificial-intelligence attention-mechanism deep-learning pytorch transformer

基于线性复杂度注意力变体的Transformer,其复杂度与序列长度成线性关系。

项目最后更新:05/05/24

GitHub Stars

843

Forks数量

78

贡献者数量

1

许可证

MIT

收录理由

这是一个紧凑的PyTorch实现,将Transformer中常见的二次复杂度注意力替换为线性复杂度变体,特别适合处理超长序列的语言模型训练或微调,因为这类场景下内存和计算开销会随序列长度急剧增长。它混合了局部(QKᵀ)V注意力和全局Q(KᵀV)注意力,使得模型在保持对整个序列感受野的同时,不必付出完整的O(n²)代价。通过pip即可安装,包内提供了现成的语言模型和普通Transformer类,还带有可逆层、前馈分块、GLU变体以及轴向注意力等调节选项。这个代码库偏向研究用途,并非持续维护的生产级框架,但对于正在原型设计高效长上下文架构、或想对比线性注意力与标准Transformer性能的工程师和研究者来说,是一份很有价值的参考。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目