#7 · 主分类: 基础模型
Qwen
chinese
flash-attention
large-language-models
llm
natural-language-processing
pretrained-models
Qwen(通义千问)聊天与预训练大语言模型的官方仓库,由阿里云提出。
项目最后更新:03/05/26
GitHub Stars
21.7K
Forks数量
1.9K
贡献者数量
34
许可证
Apache-2.0
收录理由
这是阿里云通义千问大语言模型系列的官方代码仓库,既包含预训练基座权重,也提供从1.8B到72B参数规模的指令微调对话版本。对于希望在自己硬件上部署开源权重模型、尤其是处理中文任务的团队来说,仓库里给出的推理代码、分词器以及Int4/Int8量化支持,能省去不少从零搭建的功夫。模型背后的训练与评测细节也一并公开,方便你判断Qwen在具体场景下是否合用。需要留意的是,后续开发已经转移到Qwen2代码库,这个仓库更适合作为原始Qwen一代的参考实现,而不是一个仍在积极维护的项目。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。