#92 · 主分类: 基础模型

torchscale

computer-vision machine-learning multimodal natural-language-processing pretrained-language-model speech-processing transformer translation

(多模态)大语言模型的基础架构

项目最后更新:04/11/24

GitHub Stars

3.1K

Forks数量

225

贡献者数量

16

许可证

MIT

收录理由

TorchScale 是微软开源的一个 PyTorch 库,把 RetNet、LongNet、BitNet、X-MoE 这些广为人知的模型架构创新以可运行的代码形式集中在一起。你不需要自己从头实现注意力或归一化,通过配置开关就能切换这些设计,想复现论文效果或者对比不同的大模型骨干网络时,用它当起点会很省事。代码写得相当紧凑,一条 pip 命令就能装好。不过它本质上是一套架构原语和研究代码,并不是开箱即用的预训练模型,真要落地还得自己在其上继续搭建。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目