#5 · 主分类: 合成数据生成

UltraChat

chatbot chatgpt deep-learning large-language-models

大规模、信息丰富且多样化的多轮对话数据(和模型)

项目最后更新:03/13/24

GitHub Stars

2.9K

Forks数量

144

贡献者数量

5

许可证

MIT

收录理由

想自己训练或微调对话模型的团队,多半都遇到过同一个难题:公开可用的多轮对话语料,既够大又够多样的实在不多,直接拿来做指令微调总差点意思。UltraChat 就是为了补上这块缺口而生的,它提供了大约 157 万段多轮对话,这些对话由一小批种子指令生成,覆盖了诸如世界知识问答、写作与创作等不同领域,多样性相当可观。值得留意的不只是数据本身,还有它的构建方式。作者详细说明了如何让一个大模型扮演用户,逐轮把对话延续下去,并且在每一轮都把提示语追加到历史记录中,以此避免角色混淆——这套做法对你自行生成定制化对话数据会很有参考价值。仓库里除了数据集,还放出了基于这些数据训练出来的 UltraLM 系列模型,以及训练脚本和一个以 GPT-J 为示例的实现。你可以直接拿发布的数据来用,也可以顺着这套流程研究一番,按自己的规模复现类似的高质量合成对话。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目