#9 · 主分类: 数据质量与清洗
dolma
用于生成和检查OLMo预训练数据的工具与数据。
项目最后更新:08/24/26
GitHub Stars
1.5K
Forks数量
203
贡献者数量
29
许可证
Apache-2.0
收录理由
训练自己的语言模型,第一步往往要面对大量噪声多、重复高、充满冗余的原始网页文本,Dolma 正是用来处理这些数据的工具集。它支持并行处理数十亿文档,可在文档或段落层面去重,内置包括 Gopher、C4 在内的质量与毒性标注器,并能通过混合步骤将过滤后的结果组装起来。无论是单台笔记本、集群还是基于 S3 的存储环境,它都能运行,你可以从小规模起步,随着数据增长逐步扩展。这个仓库还记录了它为 OLMo 生成的 3 万亿 token 语料库,团队可以仔细查看该数据集的具体构建方式。去重环节采用 Rust 布隆过滤器,即便输入数据以 TB 计,也能保持较快的处理速度。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
cleanlab
Cleanlab 的开源库是数据质量与机器学习处理杂乱真实世界数据和标签的标准数据为中心的人工智能包。
DataFlow
使用最新的基于LLM的操作符和流水线轻松进行数据准备。
data-juicer
基础模型的数据处理与协作! 🍎 🍋 🌽 ➡️ ➡️🍸 🍹 🍷
qsv
极速数据处理工具包
MNBVC
MNBVC(Massive Never-ending BT Vast Chinese corpus)超大规模中文语料集。对标chatGPT训练的40T数据。MNBVC数据集不但包括主流文化,也包括各个小众文化甚至火星文的数据。MNBVC数据集包括新闻、作文、小说、书籍、杂志、论文、台词、帖子、wiki、古诗、歌词、商品介绍、笑话、糗事、聊天记录等一切形式的纯文本中文数据。