#204 · 主分类: 深度学习框架

mixture-of-experts

artificial-intelligence deep-learning mixture-of-experts transformer

Pytorch实现稀疏门控混合专家,用于大幅提升语言模型参数数量。

项目最后更新:09/13/23

GitHub Stars

869

Forks数量

71

贡献者数量

1

许可证

MIT

收录理由

对想在控制计算量的前提下扩充Transformer参数规模的PyTorch开发者来说,这个库给出了一个很具体的稀疏门控专家混合层实现。它不光把Top-2门控、专家容量均衡和保证路由稳定的辅助损失都做好了,还额外提供了GShard论文里那种两层级联的变体。你可以直接沿用内置的默认设定,也很容易替换成自己的专家网络,灵活性不错。不过要留意:项目作者现在已经建议把生产用途放到更新的st-moe-pytorch上,所以这个仓库更多是作为一份精简且可读的代码参考,帮人搞清楚稀疏门控机制在实际代码里是怎么运作的。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目