#98 · 主分类: 基础模型
ChatLM-mini-Chinese
中文对话0.2B小模型(ChatLM-Chinese-0.2B),开源所有数据集来源、数据清洗、tokenizer训练、模型预训练、SFT指令微调、RLHF优化等流程的全部代码。支持下游任务sft微调,给出三元组信息抽取微调示例。
项目最后更新:04/20/24
GitHub Stars
1.7K
Forks数量
192
贡献者数量
3
许可证
Apache-2.0
收录理由
ChatLM-mini-Chinese的出发点很朴素:主流大模型参数动辄数十亿,消费级电脑连推理都吃力,更别提从头训练。这个项目干脆在低配置环境下,从零训练一个实用的中文对话模型。最终模型参数仅0.2B,float16加载只需约512MB显存,单张4GB显卡就能完成预训练。整个流程完全透明:数据来源、清洗与mini-hash去重代码、tokenizer训练、预训练、SFT指令微调、DPO偏好优化,全部开源。自定义训练器支持单卡或多卡运行,也能从任意检查点恢复训练。项目还给出了一个三元组信息抽取的微调示例,在保持对话能力的同时完成下游任务。它既是一个可直接部署的小模型,也是一份完整的中文大模型构建参考。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。