#10 · 主分类: 合成数据生成
synthetic-data-kit
用于生成高质量合成数据集的工具
项目最后更新:10/28/25
GitHub Stars
1.6K
Forks数量
236
贡献者数量
16
许可证
MIT
收录理由
微调模型时,数据通常得是用户与助手的对话轮次,而手头的原始文档往往远不是这个形态。这套命令行工具正好补上这段落差:它能读入 PDF、HTML、Word、幻灯片、YouTube 字幕和纯文本,再调用你已有的 LLM 后端(比如本地起一个 vLLM 服务,或者随便接一个 API 端点),生成问答对或带思维链的推理样例。中间还有一道筛选环节,让 Llama 自己当裁判,给生成结果打分,把质量不高的样本剔掉,最后才落到你的最终数据集里。收尾的导出命令支持 Alpaca、OpenAI 等常见微调格式,产出的数据能直接喂给训练流程。如果你已经跑着 LLM 接口,只差一个靠谱的办法把原始材料转成带标注的训练数据,这个工具能全程搞定,又不需要上什么重型平台。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。