#98 · 主分类: 基础模型

ChatLM-mini-Chinese

chatbot language-model t5-model text-generation

中文对话0.2B小模型(ChatLM-Chinese-0.2B),开源所有数据集来源、数据清洗、tokenizer训练、模型预训练、SFT指令微调、RLHF优化等流程的全部代码。支持下游任务sft微调,给出三元组信息抽取微调示例。

项目最后更新:04/20/24

GitHub Stars

1.7K

Forks数量

192

贡献者数量

3

许可证

Apache-2.0

收录理由

ChatLM-mini-Chinese的出发点很朴素:主流大模型参数动辄数十亿,消费级电脑连推理都吃力,更别提从头训练。这个项目干脆在低配置环境下,从零训练一个实用的中文对话模型。最终模型参数仅0.2B,float16加载只需约512MB显存,单张4GB显卡就能完成预训练。整个流程完全透明:数据来源、清洗与mini-hash去重代码、tokenizer训练、预训练、SFT指令微调、DPO偏好优化,全部开源。自定义训练器支持单卡或多卡运行,也能从任意检查点恢复训练。项目还给出了一个三元组信息抽取的微调示例,在保持对话能力的同时完成下游任务。它既是一个可直接部署的小模型,也是一份完整的中文大模型构建参考。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目