#3 · 主分类: 数据质量与清洗
data-juicer
基础模型的数据处理与协作! 🍎 🍋 🌽 ➡️ ➡️🍸 🍹 🍷
项目最后更新:08/28/26
GitHub Stars
7.0K
Forks数量
412
贡献者数量
54
许可证
Apache-2.0
收录理由
做模型训练的人,往往把大量时间耗在数据清洗上,而不是模型本身。Data-Juicer 把这件事变成了一套可拼装的积木:它提供了 200 多个可组合的处理算子,覆盖文本、图像、音频、视频数据的清洗、过滤、去重和结构重整,专门服务于基础模型相关的数据准备工作。流水线用带版本的 YAML 配方来定义,意味着整个处理过程可以像代码一样提交、共享和复现,团队协作时数据预处理不再依赖个人记忆或口头约定。同样的算子既能在笔记本上跑通小规模实验,也能借助 Ray 集群处理数 TB 的预训练语料,原型验证和规模化生产用的是同一套构件。无论是为预训练、指令微调、强化学习、RAG 构建数据,还是整理具身智能体的交互轨迹,使用者拿到的都是现成可用的模块,省去了自己写胶水代码的麻烦。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
cleanlab
Cleanlab 的开源库是数据质量与机器学习处理杂乱真实世界数据和标签的标准数据为中心的人工智能包。
DataFlow
使用最新的基于LLM的操作符和流水线轻松进行数据准备。
qsv
极速数据处理工具包
MNBVC
MNBVC(Massive Never-ending BT Vast Chinese corpus)超大规模中文语料集。对标chatGPT训练的40T数据。MNBVC数据集不但包括主流文化,也包括各个小众文化甚至火星文的数据。MNBVC数据集包括新闻、作文、小说、书籍、杂志、论文、台词、帖子、wiki、古诗、歌词、商品介绍、笑话、糗事、聊天记录等一切形式的纯文本中文数据。
Curator
面向大语言模型的可扩展数据预处理与整理工具包