#7 · 主分类: 合成数据生成
DataDesigner
🎨 NeMo Data Designer:从零开始或从种子数据生成高质量合成数据。
项目最后更新:08/28/26
GitHub Stars
2.2K
Forks数量
202
贡献者数量
25
许可证
Apache-2.0
收录理由
当训练任务因缺乏多样且结构良好的样本而停滞时,DataDesigner 值得一试。它不是围绕大模型提示词的一层薄封装,而是一套可配置的流水线:统计采样器、种子数据与语言模型协同工作,产出带有你所需分布和字段相关性的数据集。内置的 Python 或 SQL 校验器,加上自定义检查,配合大模型作为评判的打分环节,能在劣质数据进入下游任务前将其拦截;预览模式则让你在投入完整生成的 token 之前先调好配方。异步引擎会并行处理独立的列,并针对不同供应商和模型自适应并发度,大多数流水线无需改动配置就能跑得更快。它正好介于临时脚本和重型数据平台之间,而许多团队最终就落在那个位置。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。