#118 · 主分类: 深度学习框架
titans-pytorch
非官方实现的Titans,用于transformers的SOTA记忆,基于Pytorch
项目最后更新:07/13/26
GitHub Stars
2.0K
Forks数量
207
贡献者数量
2
许可证
MIT
收录理由
Transformer 在上下文窗口拉长后容易力不从心,Titans 系列研究通过引入一个在测试阶段持续学习的神经记忆模块来应对这一瓶颈。这个仓库是它的非官方 PyTorch 实现,开箱即用的组件包括独立的 NeuralMemory 模块,以及将局部注意力与持久记忆、长期记忆 token 结合起来的 MemoryAsContextTransformer。两者都很轻量、易于组合,一条 pip 命令即可安装,融入现有训练流程不费什么功夫。仓库自带的训练与采样脚本提供了可运行的基线,适合用来快速验证长上下文语言模型的原型。需要说明的是,这里提供的是实现代码而非预训练模型,想判断这套架构在你自己的数据上表现如何,得先投入实实在在的训练时间。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。