#116 · 主分类: 基础模型
PaLM-pytorch
artificial-general-intelligence
attention-mechanism
deep-learning
transformers
PaLM - 通过路径扩展语言建模中的特定Transformer架构的实现
项目最后更新:11/09/22
GitHub Stars
824
Forks数量
81
贡献者数量
3
许可证
MIT
收录理由
这个项目用不到两百行PyTorch代码,把Google在PaLM论文里描述的Transformer架构原样复现了出来。作者写它的初衷是教学,不是拿来跑生产,所以代码刻意保持精简,你可以顺着注意力机制、前馈模块和归一化的具体选择,直接对照论文一步步看明白,不用在庞大的代码库里翻找。拿它搭一个小规模的PaLM风格模型,在Enwik8这类数据集上跑跑训练,设计上的取舍就能直观感受到。虽然它没法扩展到论文里540B参数那种规模,但如果你想弄懂Transformer内部原理,或者想在自己的实验里借鉴PaLM的思路,这份干净、依赖少的代码很容易上手改造。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。