#33 · 主分类: 商业智能与分析

vaex

bigdata data-science dataframe hdf5 machine-learning machinelearning memory-mapped-file pyarrow python tabular-data visualization

面向Python、机器学习、可视化和探索大数据表格的外存混合Apache Arrow/NumPy DataFrame,每秒处理十亿行 🚀

项目最后更新:04/01/26

GitHub Stars

8.5K

Forks数量

602

贡献者数量

76

许可证

MIT

收录理由

当数据量超出内存容量时,多数表格工具会变得寸步难行,而 Vaex 正是为解决这类场景而生。它借助内存映射机制读取文件,无需将整个数据集载入内存,就能完成统计计算、绘制直方图和密度图,并支持对数十亿行数据进行筛选。其惰性表达式系统允许用户定义虚拟列,这些列在实际计算时才会求值,即使数据始终存放在磁盘上,也能在 Jupyter 中保持流畅的交互体验。对于早期数据探索、模型训练前的特征筛选,或是直接对 HDF5 与 Arrow 文件做临时分析,它都是比启动集群更便捷的选择。内置的绘图功能与 Jupyter 组件支持,也让快速查看大规模数据变得轻松。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目