#38 · 主分类: 经典机器学习框架

mars

dask dataframe joblib lightgbm machine-learning numpy pandas python pytorch ray scikit-learn statsmodels tensor tensorflow xgboost

Mars是一个基于张量的统一框架,用于大规模数据计算,扩展了numpy、pandas、scikit-learn和Python函数。

项目最后更新:01/02/24

GitHub Stars

2.7K

Forks数量

324

贡献者数量

53

许可证

Apache-2.0

收录理由

当单机上的pandas和scikit-learn已经难以应对数据规模时,Mars提供了一条平滑的升级路径,不必抛弃熟悉的代码习惯。它把那些常用接口包装成惰性求值的张量、数据框和机器学习模块,原本会在笔记本上内存溢出的计算,只需少量改动就能放到集群上运行。框架自己负责数据分块、任务调度和跨核或跨节点的执行,对于超出内存的数据集,做数据清洗、特征工程以及PCA、聚类这类经典建模都很顺手。同时它兼容joblib,也能与XGBoost、LightGBM等库配合,因而可以自然嵌入依赖Python数据生态的既有流水线。如果你希望在不放弃当前工作流的前提下获得分布式数据处理能力,Mars值得认真考察。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目