#776 · 主分类: 教育与研究

pytorch-original-transformer

attention attention-is-all-you-need attention-mechanism deep-learning deeplearning jupyter original-transformer python pytorch pytorch-transformer pytorch-transformers transformer transformer-tutorial transformers

我对原始 transformer 模型(Vaswani 等人)的实现。我还额外包含了 playground.py 文件,用于可视化原本看似困难的概念。目前包含 IWSLT 预训练模型。

项目最后更新:12/27/20

GitHub Stars

1.1K

Forks数量

188

贡献者数量

1

许可证

MIT

收录理由

这个仓库把Vaswani等人提出的原始Transformer架构用PyTorch重新实现了一遍,定位是帮人把概念吃透,而不是刷榜单分数。代码注释写得很密,每个组件都在出现的地方直接解释,不会让你面对一个黑盒般的库函数。最值得先打开的是playground.py脚本,它把位置编码和自定义学习率调度这类文字说起来容易、光看公式却很难在脑子里成像的东西,直接画成图给你看。仓库里还带了预训练好的IWSLT翻译模型和配套的notebook,理论看到有感觉的时候,马上就能跑起真实的东西。对于想弄明白现代大语言模型底层逻辑的学生或者自学工程师来说,这里是个友好的起点,先把直觉建立起来,再去碰更上层的框架也不迟。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目