#6 · 主分类: 数据质量与清洗

Curator

data data-curation data-prep data-preparation data-processing data-processing-pipelines data-quality datacuration datarecipes deduplication fast-data-processing fine-tuning large-language-models large-scale-data-processing llm llm-data-quality llmapps python semantic-deduplication

面向大语言模型的可扩展数据预处理与整理工具包

项目最后更新:08/29/26

GitHub Stars

1.7K

Forks数量

320

贡献者数量

70

许可证

Apache-2.0

收录理由

给大模型做预训练或微调,数据准备往往是重复劳动:清洗嘈杂的网页抓取、去重文档,这些脚本换个项目就得重写一遍。NeMo Curator把这些活儿打包成可复用的流水线,笔记本上能跑,多节点Ray集群上也能跑,本地调试完直接放大规模,不用改代码。GPU加速是实打实的好处,原本单机要磨很久的任务,变成分布式跑就快多了。它还管图像、视频和音频数据的整理,多模态和语音的活儿都能在同一个代码库里搞定,不必再另搭一套工具。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目