#41 · 主分类: AI数据基础设施与存储

petastorm

deep-learning machine-learning parquet parquet-files pyarrow pyspark pytorch sysml tensorflow

Petastorm库支持从Apache Parquet格式的数据集中进行单机或分布式深度学习模型的训练和评估。它支持Tensorflow、Pytorch和PySpark等ML框架,并可从纯Python代码中使用。

项目最后更新:01/02/26

GitHub Stars

1.9K

Forks数量

286

贡献者数量

52

许可证

Apache-2.0

收录理由

Petastorm 是一个面向深度学习训练的数据访问库,它允许模型直接从 Apache Parquet 文件读取数据,省去了将训练数据转换成各框架专用格式的麻烦。无论是 TensorFlow、PyTorch 还是 PySpark,甚至纯 Python 环境,都能通过它统一接入,相当于在现有数据湖和模型代码之间架起了一座便捷的桥梁。实际工程中那些常被忽视却耗时的工作,比如按需读取特定列、数据打乱、行过滤、多 GPU 训练时的分区处理以及本地缓存,它都替你处理好了。如果团队的数据已经以 Parquet 格式存储,又希望在不同框架间共用一套加载逻辑,这个库能省下大量胶水代码。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目