#6 · 主分类: 数据质量与清洗
Curator
面向大语言模型的可扩展数据预处理与整理工具包
项目最后更新:08/29/26
GitHub Stars
1.7K
Forks数量
320
贡献者数量
70
许可证
Apache-2.0
收录理由
给大模型做预训练或微调,数据准备往往是重复劳动:清洗嘈杂的网页抓取、去重文档,这些脚本换个项目就得重写一遍。NeMo Curator把这些活儿打包成可复用的流水线,笔记本上能跑,多节点Ray集群上也能跑,本地调试完直接放大规模,不用改代码。GPU加速是实打实的好处,原本单机要磨很久的任务,变成分布式跑就快多了。它还管图像、视频和音频数据的整理,多模态和语音的活儿都能在同一个代码库里搞定,不必再另搭一套工具。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
cleanlab
Cleanlab 的开源库是数据质量与机器学习处理杂乱真实世界数据和标签的标准数据为中心的人工智能包。
DataFlow
使用最新的基于LLM的操作符和流水线轻松进行数据准备。
data-juicer
基础模型的数据处理与协作! 🍎 🍋 🌽 ➡️ ➡️🍸 🍹 🍷
qsv
极速数据处理工具包
MNBVC
MNBVC(Massive Never-ending BT Vast Chinese corpus)超大规模中文语料集。对标chatGPT训练的40T数据。MNBVC数据集不但包括主流文化,也包括各个小众文化甚至火星文的数据。MNBVC数据集包括新闻、作文、小说、书籍、杂志、论文、台词、帖子、wiki、古诗、歌词、商品介绍、笑话、糗事、聊天记录等一切形式的纯文本中文数据。