#211 · 主分类: 深度学习框架
performer-pytorch
artificial-intelligence
attention
attention-mechanism
deep-learning
transformers
在Pytorch中实现Performer,一种基于线性注意力的Transformer
项目最后更新:02/02/22
GitHub Stars
1.2K
Forks数量
148
贡献者数量
6
许可证
MIT
收录理由
这个库为需要处理超长序列的机器学习工程师和研究者提供了Performer架构的PyTorch实现。它把FAVOR+随机特征线性注意力机制封装成了现成的模块,包括语言模型、编码器-解码器对,以及独立的自注意力和交叉注意力层。有了它,想扩大上下文窗口时就不用从头实现论文里的数学推导了。项目还整合了其他相关工作里的效率技巧,比如可逆层、局部注意力头、GLU前馈和旋转位置编码,这让它成为做长上下文实验的可靠基础。由于提供的是纯粹的构建模块而非预训练权重,它同时也是一个直观的学习工具,能让人看清线性注意力到底是怎么组装起来的。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。