#4 · 主分类: 数据目录与元数据管理

LLMDataHub

chatbot chatgpt dataset llm

一份(尤其是)针对热门指令微调数据集的快速指南

项目最后更新:11/28/23

GitHub Stars

3.4K

Forks数量

234

贡献者数量

1

许可证

MIT

收录理由

自己动手训练或微调一个能听话的模型,最让人头疼的往往不是模型结构,而是上哪儿找合适的训练数据。这个仓库把大量公开可用的数据集收拢到了一处,按用途分成对齐、领域专属、预训练和多模态几大类,每一份数据都标了规模、语言、类型以及是哪个已发布模型用过它——挑数据时这些信息最管用,照着Alpaca那套做法来选料能省不少功夫。它不是拿来跑的工具,而是一张人工整理好的参考地图,省得你在Hugging Face和各种研究库里翻来翻去。条目里还记录了每份数据的出现时间,所以想了解某个阶段市面上有哪些可用资源,也能看个明白。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目