#8 · 主分类: 合成数据生成

curator

agents deep-learning fine-tuning instruction-tuning llm machine-learning natural-language-processing prompt python synthetic-data synthetic-dataset-generation

用于后训练和结构化数据提取的合成数据策展

项目最后更新:08/07/26

GitHub Stars

1.7K

Forks数量

146

贡献者数量

23

许可证

Apache-2.0

收录理由

做后训练的人大多有同感:凑训练数据往往是微调里最折腾的一环,Curator直接盯住这个环节下手。你只需写一个普通的Python函数去调用模型,剩下的批量执行交给它,上千行数据的请求分发、缓存和出错恢复都在后台自动处理,生成推理轨迹、指令对或结构化JSON时,不必整夜守着一个长任务。同一套流程还能用来做结构化信息抽取,一个接口既服务准备训练数据的团队,也服务从杂乱文档里提取JSON的团队。无论是把强模型蒸馏成小模型,还是拼SFT或RLHF数据集,它都是个扎实又省心的起点。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目