#62 · 主分类: 基础模型

Chinese-Mixtral

32k 64k large-language-models llm mixtral mixture-of-experts moe nlp

中文Mixtral混合专家大模型

项目最后更新:04/19/26

GitHub Stars

612

Forks数量

43

贡献者数量

2

许可证

Apache-2.0

收录理由

Chinese-Mixtral 以 Mixtral-8x7B 稀疏混合专家模型为基础,在大规模中文无标注数据上继续训练,得到基础模型和指令精调两个版本,让模型直接以中文为母语工作,而不是依赖通用检查点勉强应付。原生 32K 上下文窗口(实测可达 128K)对长文档处理很实用,同时项目公开了预训练和指令精调脚本,你可以按自己的领域继续调整权重。量化后的 GGUF 版本通过 llama.cpp 运行,最低只需 16GB 内存,模型也能直接接入 transformers、vLLM、LangChain 等现有生态。随项目发布的还有一篇技术报告,详细说明了语言适配的思路,如果你正在评估继续预训练是否适合自家路线,这份材料会很有参考价值。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目