#101 · 主分类: 基础模型

xlnet

deep-learning nlp tensorflow

XLNet:用于语言理解的广义自回归预训练

项目最后更新:05/28/23

GitHub Stars

6.2K

Forks数量

1.1K

贡献者数量

12

许可证

Apache-2.0

收录理由

XLNet 作者将本仓库作为模型的官方参考实现发布,想要真正理解一个基于 Transformer 的强语言模型如何完成预训练和微调,而不是只读论文里的描述,这里是最直接的入口。仓库随附了 Base 与 Large 两套预训练权重、SentencePiece 分词器及对应配置,还提供了文本分类、回归和阅读理解(如 SQuAD)的可运行脚本。其基于排列的自回归预训练目标,与 BERT 流行的掩码去噪思路截然不同;而 Transformer-XL 作为骨干结构,在处理长文本依赖的任务上更有优势。需要留意的是,代码面向 TensorFlow 1.x 编写,并以 TPU 训练为主要场景,如今并不适合直接作为生产级推理服务,更适合当作复现实验和剖析模型内部机制的参考资料。对于希望在预训练方法上做二次开发或深入学习的团队而言,这份代码的研究价值仍然很高,值得花些时间搭建环境去体验。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目