#103 · 主分类: 基础模型

Chinese-Mixtral-8x7B

large-language-models llm mixtral-8x7b nlp

中文Mixtral-8x7B

项目最后更新:08/17/24

GitHub Stars

651

Forks数量

33

贡献者数量

2

许可证

Apache-2.0

收录理由

这个项目把Mistral的Mixtral-8x7B混合专家模型重新改造,专门面向中文场景。团队扩展了分词器的词表,并在大规模中文语料上做了增量预训练,使得模型处理中文时每个句子所需的token数明显少于原版,这种效率提升对想在MoE架构上构建中文应用的人来说很有吸引力。仓库同时放出了合并后的完整权重供直接使用,也提供了LoRA适配器和完整的扩词表及QLoRA预训练流程,想复现类似语言适配工作的人可以拿它当参考。需要注意的是,这是个基座模型而非指令微调版本,实际使用前需要针对自己的任务做微调,项目也指向了同系列的指令微调版本供选用。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目