#2 · 主分类: 数据质量与清洗

DataFlow

data data-agent data-cleaning data-pipelines data-processing data-science data-synthesis gradio-interface llms operators quick-data-processing sglang-bankend vllm-backend

使用最新的基于LLM的操作符和流水线轻松进行数据准备。

项目最后更新:08/18/26

GitHub Stars

7.8K

Forks数量

1.1K

贡献者数量

58

许可证

Apache-2.0

收录理由

DataFlow 把数据准备从零散脚本变成可复用的流水线:原始文本、PDF 和代码都能被整理成适合大模型微调、预训练或 RAG 的高质量训练数据。你不需要每次写一次性代码,而是用现成的算子把清洗和合成步骤串起来,覆盖文本、数学、代码生成,甚至能大规模把 PDF 转成问答对。内置的数据代理还能按需重组现有算子或草拟新算子,所以搭建新流程时不必手动敲完所有逻辑。可视化 WebUI 和 Gradio 界面让你用图形方式构建流水线,不用直接改 Python;而流水线本身活在 Git/Python 生态里,版本管理、分享和团队内复用都很顺手。对处理文档密集型数据集的数据团队和机器学习工程师来说,它重视领域特定高质量数据的取向尤其有实际价值。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目