#3 · 主分类: 数据质量与清洗

data-juicer

data data-analysis data-pipeline data-processing data-science data-visualization foundation-models instruction-tuning large-language-models llm llms multi-modal pre-training synthetic-data

基础模型的数据处理与协作! 🍎 🍋 🌽 ➡️ ➡️🍸 🍹 🍷

项目最后更新:08/28/26

GitHub Stars

7.0K

Forks数量

412

贡献者数量

54

许可证

Apache-2.0

收录理由

做模型训练的人,往往把大量时间耗在数据清洗上,而不是模型本身。Data-Juicer 把这件事变成了一套可拼装的积木:它提供了 200 多个可组合的处理算子,覆盖文本、图像、音频、视频数据的清洗、过滤、去重和结构重整,专门服务于基础模型相关的数据准备工作。流水线用带版本的 YAML 配方来定义,意味着整个处理过程可以像代码一样提交、共享和复现,团队协作时数据预处理不再依赖个人记忆或口头约定。同样的算子既能在笔记本上跑通小规模实验,也能借助 Ray 集群处理数 TB 的预训练语料,原型验证和规模化生产用的是同一套构件。无论是为预训练、指令微调、强化学习、RAG 构建数据,还是整理具身智能体的交互轨迹,使用者拿到的都是现成可用的模块,省去了自己写胶水代码的麻烦。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目