#62 · 主分类: 基础模型
Chinese-Mixtral
中文Mixtral混合专家大模型
项目最后更新:04/19/26
GitHub Stars
612
Forks数量
43
贡献者数量
2
许可证
Apache-2.0
收录理由
Chinese-Mixtral 以 Mixtral-8x7B 稀疏混合专家模型为基础,在大规模中文无标注数据上继续训练,得到基础模型和指令精调两个版本,让模型直接以中文为母语工作,而不是依赖通用检查点勉强应付。原生 32K 上下文窗口(实测可达 128K)对长文档处理很实用,同时项目公开了预训练和指令精调脚本,你可以按自己的领域继续调整权重。量化后的 GGUF 版本通过 llama.cpp 运行,最低只需 16GB 内存,模型也能直接接入 transformers、vLLM、LangChain 等现有生态。随项目发布的还有一篇技术报告,详细说明了语言适配的思路,如果你正在评估继续预训练是否适合自家路线,这份材料会很有参考价值。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。