#100 · 主分类: 基础模型

MEGABYTE-pytorch

artificial-intelligence attention-mechanisms deep-learning learned-tokenization long-context transformers

MEGABYTE的Pytorch实现:使用多尺度Transformer预测百万字节序列

项目最后更新:12/27/24

GitHub Stars

655

Forks数量

55

贡献者数量

2

许可证

MIT

收录理由

MEGABYTE-pytorch 以紧凑且易读的代码实现了 MEGABYTE 架构,这是一种多尺度 Transformer,能够在无需分词器的情况下处理长达百万字节的序列。其设计将输入切分为补丁,并用一个较大的全局 Transformer 搭配多个较小的局部子模型,从而将自注意力计算复杂度降至次二次方,并把节省下来的算力用于更宽的前馈层。作者在论文基础上做了进一步泛化,允许堆叠超过两层的全局与局部模型,这让代码成为研究长上下文或无分词建模的实用起点。安装只需一条 pip 命令,API 直接支持训练、损失计算和采样,还附带字符级 enwik8 训练脚本用于验证环境。它属于研究型构建模块,而非开箱即用的应用,需要自行准备数据和训练流程;但对于探索字节级与长序列 Transformer 设计的人来说,这是一份扎实的参考实现。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目