#38 · 主分类: 经典机器学习框架
mars
Mars是一个基于张量的统一框架,用于大规模数据计算,扩展了numpy、pandas、scikit-learn和Python函数。
项目最后更新:01/02/24
GitHub Stars
2.7K
Forks数量
324
贡献者数量
53
许可证
Apache-2.0
收录理由
当单机上的pandas和scikit-learn已经难以应对数据规模时,Mars提供了一条平滑的升级路径,不必抛弃熟悉的代码习惯。它把那些常用接口包装成惰性求值的张量、数据框和机器学习模块,原本会在笔记本上内存溢出的计算,只需少量改动就能放到集群上运行。框架自己负责数据分块、任务调度和跨核或跨节点的执行,对于超出内存的数据集,做数据清洗、特征工程以及PCA、聚类这类经典建模都很顺手。同时它兼容joblib,也能与XGBoost、LightGBM等库配合,因而可以自然嵌入依赖Python数据生态的既有流水线。如果你希望在不放弃当前工作流的前提下获得分布式数据处理能力,Mars值得认真考察。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。