#92 · 主分类: 基础模型
torchscale
computer-vision
machine-learning
multimodal
natural-language-processing
pretrained-language-model
speech-processing
transformer
translation
(多模态)大语言模型的基础架构
项目最后更新:04/11/24
GitHub Stars
3.1K
Forks数量
225
贡献者数量
16
许可证
MIT
收录理由
TorchScale 是微软开源的一个 PyTorch 库,把 RetNet、LongNet、BitNet、X-MoE 这些广为人知的模型架构创新以可运行的代码形式集中在一起。你不需要自己从头实现注意力或归一化,通过配置开关就能切换这些设计,想复现论文效果或者对比不同的大模型骨干网络时,用它当起点会很省事。代码写得相当紧凑,一条 pip 命令就能装好。不过它本质上是一套架构原语和研究代码,并不是开箱即用的预训练模型,真要落地还得自己在其上继续搭建。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。