#4 · 主分类: 合成数据生成

synthetic-data-generator

agent data-generator deep-learning gan generative-ai llm machine-learning privacy synthetic-data tabular-data

SDG 是一个专用框架,旨在生成高质量的结构化表格数据。

项目最后更新:08/17/26

GitHub Stars

2.4K

Forks数量

392

贡献者数量

17

许可证

Apache-2.0

收录理由

需要在不暴露真实记录的前提下获得贴近实际的表格数据,这个项目值得一看。它把单表与多表合成算法和LLM驱动生成放在一起,想快速出数时可以用经典模型,遇到复杂的表结构和关系时再交给语言模型。那些不太显眼但很关键的部分它也没有落下,比如十亿行级别的工作负载和注重隐私的生成方式——当产出要在多个团队之间流转,或者要拿去支撑下游测试和分析时,这点尤其重要。项目以Python包的形式发布,配有Colab示例和API文档,无论是快速试个想法,还是搭建更讲究的流水线,都能派上用场。如果你过去一直靠手工拼凑假数据,或者在不同生成器之间来回切换,这套更连贯的方案值得纳入你的评估范围。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目