#38 · 主分类: AI数据基础设施与存储

webdataset

data-augmentation deep-learning pytorch webdataset webdataset-format

一个高性能的基于Python的I/O系统,用于大型(和小型)深度学习问题,对PyTorch有强力支持。

项目最后更新:02/09/26

GitHub Stars

3.2K

Forks数量

234

贡献者数量

58

许可证

BSD-3-Clause

收录理由

当训练数据规模超出普通文件夹能从容应对的范围时,I/O往往成为瓶颈,WebDataset正是为此而生。它将样本打包进分片的tar归档,并以顺序流方式读取,无论数据位于本地磁盘还是云端存储桶,都能保持较快的加载速度。每个tar条目按共享基名归组一个样本的全部内容,编号分片则让跨机器拆分任务变得直观。该Python库可接入PyTorch的IterableDataset,你原有的解码与增强流程照常使用,结果仍交给DataLoader处理。媒体文件保持原生格式,制作WebDataset归档就像创建tar文件一样简单。顺序I/O配合简洁打包,使许多训练大型视觉或语言模型的团队选择它,而不愿与成千上万个散落文件纠缠。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目