#8 · 主分类: 合成数据生成
curator
agents
deep-learning
fine-tuning
instruction-tuning
llm
machine-learning
natural-language-processing
prompt
python
synthetic-data
synthetic-dataset-generation
用于后训练和结构化数据提取的合成数据策展
项目最后更新:08/07/26
GitHub Stars
1.7K
Forks数量
146
贡献者数量
23
许可证
Apache-2.0
收录理由
做后训练的人大多有同感:凑训练数据往往是微调里最折腾的一环,Curator直接盯住这个环节下手。你只需写一个普通的Python函数去调用模型,剩下的批量执行交给它,上千行数据的请求分发、缓存和出错恢复都在后台自动处理,生成推理轨迹、指令对或结构化JSON时,不必整夜守着一个长任务。同一套流程还能用来做结构化信息抽取,一个接口既服务准备训练数据的团队,也服务从杂乱文档里提取JSON的团队。无论是把强模型蒸馏成小模型,还是拼SFT或RLHF数据集,它都是个扎实又省心的起点。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。