#159 · 主分类: 深度学习框架
EBT
用于基于能量的Transformer论文的PyTorch代码——可泛化推理与可扩展学习
项目最后更新:04/21/26
GitHub Stars
651
Forks数量
89
贡献者数量
4
许可证
Apache-2.0
收录理由
Energy-Based Transformers 走了一条与标准前馈堆叠不同的技术路线:模型在预测每一个 token 时都会进行推理,而不是只做一次前向传播。仓库为论文提供了语言、图像、视频三种模态的预训练与推理脚本,还有一个极简的单文件训练循环,把 Transformer++ 基线和 EBT 放在一起对比,想快速理解机制的话这是最直接的入口。需要说明的是,这是研究代码而非现成库,作业脚本、wandb 配置和 HPC 启动器都要按你自己的集群环境去调整。如果你正在做 System 2 推理、能量基目标函数,或者关心替代注意力架构如何扩展规模,从这里开始复现论文实验是个扎实的起点。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。