#237 · 主分类: 深度学习框架

RETRO-pytorch

artificial-intelligence attention-mechanism deep-learning retrieval transformers

RETRO的Pytorch实现,即Deepmind的基于检索的注意力网络。

项目最后更新:10/30/23

GitHub Stars

878

Forks数量

108

贡献者数量

7

许可证

Apache-2.0

收录理由

RETRO-pytorch 把 DeepMind 那篇 RETRO 论文变成了真正能跑起来的代码。模型会先在你自己的语料上建好索引,生成时每个 chunk 都去检索邻近文本并参与条件计算,这样生成过程依赖外部数据库,而不是把所有东西都塞进权重里。那些容易出错的细节都已经处理妥当:分块的因果交叉注意力、旋转位置编码、支持极深网络的 deep-norm 缩放,索引构建和近邻搜索则交给 Faiss 和 autofaiss 完成。另外还提供了训练封装和数据集工具,能把纯文本文件夹直接转成训练所需的 memory-mapped 数组和邻居引用。RETRO 的卖点是用十分之一的参数达到 GPT-3 的效果,想在自己数据上验证这个说法,这里是一个现成的起点。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目