#2 · 主分类: 数据质量与清洗
DataFlow
使用最新的基于LLM的操作符和流水线轻松进行数据准备。
项目最后更新:08/18/26
GitHub Stars
7.8K
Forks数量
1.1K
贡献者数量
58
许可证
Apache-2.0
收录理由
DataFlow 把数据准备从零散脚本变成可复用的流水线:原始文本、PDF 和代码都能被整理成适合大模型微调、预训练或 RAG 的高质量训练数据。你不需要每次写一次性代码,而是用现成的算子把清洗和合成步骤串起来,覆盖文本、数学、代码生成,甚至能大规模把 PDF 转成问答对。内置的数据代理还能按需重组现有算子或草拟新算子,所以搭建新流程时不必手动敲完所有逻辑。可视化 WebUI 和 Gradio 界面让你用图形方式构建流水线,不用直接改 Python;而流水线本身活在 Git/Python 生态里,版本管理、分享和团队内复用都很顺手。对处理文档密集型数据集的数据团队和机器学习工程师来说,它重视领域特定高质量数据的取向尤其有实际价值。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
cleanlab
Cleanlab 的开源库是数据质量与机器学习处理杂乱真实世界数据和标签的标准数据为中心的人工智能包。
data-juicer
基础模型的数据处理与协作! 🍎 🍋 🌽 ➡️ ➡️🍸 🍹 🍷
qsv
极速数据处理工具包
MNBVC
MNBVC(Massive Never-ending BT Vast Chinese corpus)超大规模中文语料集。对标chatGPT训练的40T数据。MNBVC数据集不但包括主流文化,也包括各个小众文化甚至火星文的数据。MNBVC数据集包括新闻、作文、小说、书籍、杂志、论文、台词、帖子、wiki、古诗、歌词、商品介绍、笑话、糗事、聊天记录等一切形式的纯文本中文数据。
Curator
面向大语言模型的可扩展数据预处理与整理工具包