#38 · 主分类: AI数据基础设施与存储
webdataset
一个高性能的基于Python的I/O系统,用于大型(和小型)深度学习问题,对PyTorch有强力支持。
项目最后更新:02/09/26
GitHub Stars
3.2K
Forks数量
234
贡献者数量
58
许可证
BSD-3-Clause
收录理由
当训练数据规模超出普通文件夹能从容应对的范围时,I/O往往成为瓶颈,WebDataset正是为此而生。它将样本打包进分片的tar归档,并以顺序流方式读取,无论数据位于本地磁盘还是云端存储桶,都能保持较快的加载速度。每个tar条目按共享基名归组一个样本的全部内容,编号分片则让跨机器拆分任务变得直观。该Python库可接入PyTorch的IterableDataset,你原有的解码与增强流程照常使用,结果仍交给DataLoader处理。媒体文件保持原生格式,制作WebDataset归档就像创建tar文件一样简单。顺序I/O配合简洁打包,使许多训练大型视觉或语言模型的团队选择它,而不愿与成千上万个散落文件纠缠。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
ClickHouse
ClickHouse® 是一个实时分析数据库管理系统
simdjson
每秒解析数GB的JSON:被Facebook/Meta Velox、Node.js运行时、ClickHouse、WatermelonDB、Apache Doris、Milvus、StarRocks使用
gun
开源网络安全协议,用于同步去中心化图数据。
emqx
为AI、IoT、IIoT和联网车辆提供最可扩展且可靠的MQTT broker
server
MariaDB服务器是MySQL服务器的社区开发分支。由原MySQL团队核心成员发起,MariaDB积极与外部开发者合作,提供业界功能最丰富、稳定且许可合理的开源SQL服务器。