#78 · 主分类: 基础模型

Baichuan-7B

artificial-intelligence ceval chatgpt chinese gpt-4 huggingface large-language-models llama mmlu natural-language-processing

由百川智能开发的大规模7B预训练语言模型。

项目最后更新:07/18/24

GitHub Stars

5.6K

Forks数量

501

贡献者数量

11

许可证

Apache-2.0

收录理由

百川智能推出的Baichuan-7B是一个70亿参数规模的预训练语言模型,采用Apache 2.0许可发布,商用门槛低。模型在约1.2万亿tokens上完成训练,支持4096长度的上下文窗口,仓库里直接给出了tokenizer、评估脚本,以及数据过滤和混合的详细说明,照着就能复现论文里C-Eval、MMLU、高考和AGIEval的评测结果。中文优化的tokenizer加上熟悉的LLaMA风格Transformer结构,让它在处理中英双语任务时显得顺手,适合作为团队二次开发的底座。需要留意的是,它属于基础模型而非对话助手,想直接做成产品得先做微调或适配对话。Hugging Face的接入很顺畅,复现命令也都公开,做研究和下游实验都很方便。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目