#116 · 主分类: 基础模型

PaLM-pytorch

artificial-general-intelligence attention-mechanism deep-learning transformers

PaLM - 通过路径扩展语言建模中的特定Transformer架构的实现

项目最后更新:11/09/22

GitHub Stars

824

Forks数量

81

贡献者数量

3

许可证

MIT

收录理由

这个项目用不到两百行PyTorch代码,把Google在PaLM论文里描述的Transformer架构原样复现了出来。作者写它的初衷是教学,不是拿来跑生产,所以代码刻意保持精简,你可以顺着注意力机制、前馈模块和归一化的具体选择,直接对照论文一步步看明白,不用在庞大的代码库里翻找。拿它搭一个小规模的PaLM风格模型,在Enwik8这类数据集上跑跑训练,设计上的取舍就能直观感受到。虽然它没法扩展到论文里540B参数那种规模,但如果你想弄懂Transformer内部原理,或者想在自己的实验里借鉴PaLM的思路,这份干净、依赖少的代码很容易上手改造。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目