#41 · 主分类: AI数据基础设施与存储
petastorm
Petastorm库支持从Apache Parquet格式的数据集中进行单机或分布式深度学习模型的训练和评估。它支持Tensorflow、Pytorch和PySpark等ML框架,并可从纯Python代码中使用。
项目最后更新:01/02/26
GitHub Stars
1.9K
Forks数量
286
贡献者数量
52
许可证
Apache-2.0
收录理由
Petastorm 是一个面向深度学习训练的数据访问库,它允许模型直接从 Apache Parquet 文件读取数据,省去了将训练数据转换成各框架专用格式的麻烦。无论是 TensorFlow、PyTorch 还是 PySpark,甚至纯 Python 环境,都能通过它统一接入,相当于在现有数据湖和模型代码之间架起了一座便捷的桥梁。实际工程中那些常被忽视却耗时的工作,比如按需读取特定列、数据打乱、行过滤、多 GPU 训练时的分区处理以及本地缓存,它都替你处理好了。如果团队的数据已经以 Parquet 格式存储,又希望在不同框架间共用一套加载逻辑,这个库能省下大量胶水代码。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
ClickHouse
ClickHouse® 是一个实时分析数据库管理系统
simdjson
每秒解析数GB的JSON:被Facebook/Meta Velox、Node.js运行时、ClickHouse、WatermelonDB、Apache Doris、Milvus、StarRocks使用
gun
开源网络安全协议,用于同步去中心化图数据。
emqx
为AI、IoT、IIoT和联网车辆提供最可扩展且可靠的MQTT broker
server
MariaDB服务器是MySQL服务器的社区开发分支。由原MySQL团队核心成员发起,MariaDB积极与外部开发者合作,提供业界功能最丰富、稳定且许可合理的开源SQL服务器。