#237 · 主分类: 深度学习框架
RETRO-pytorch
RETRO的Pytorch实现,即Deepmind的基于检索的注意力网络。
项目最后更新:10/30/23
GitHub Stars
878
Forks数量
108
贡献者数量
7
许可证
Apache-2.0
收录理由
RETRO-pytorch 把 DeepMind 那篇 RETRO 论文变成了真正能跑起来的代码。模型会先在你自己的语料上建好索引,生成时每个 chunk 都去检索邻近文本并参与条件计算,这样生成过程依赖外部数据库,而不是把所有东西都塞进权重里。那些容易出错的细节都已经处理妥当:分块的因果交叉注意力、旋转位置编码、支持极深网络的 deep-norm 缩放,索引构建和近邻搜索则交给 Faiss 和 autofaiss 完成。另外还提供了训练封装和数据集工具,能把纯文本文件夹直接转成训练所需的 memory-mapped 数组和邻居引用。RETRO 的卖点是用十分之一的参数达到 GPT-3 的效果,想在自己数据上验证这个说法,这里是一个现成的起点。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。