GitHub Stars
3.4K
Forks数量
234
贡献者数量
1
许可证
MIT
收录理由
自己动手训练或微调一个能听话的模型,最让人头疼的往往不是模型结构,而是上哪儿找合适的训练数据。这个仓库把大量公开可用的数据集收拢到了一处,按用途分成对齐、领域专属、预训练和多模态几大类,每一份数据都标了规模、语言、类型以及是哪个已发布模型用过它——挑数据时这些信息最管用,照着Alpaca那套做法来选料能省不少功夫。它不是拿来跑的工具,而是一张人工整理好的参考地图,省得你在Hugging Face和各种研究库里翻来翻去。条目里还记录了每份数据的出现时间,所以想了解某个阶段市面上有哪些可用资源,也能看个明白。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。