#796 · 主分类: 教育与研究

spark-ml-source-analysis

machine-learning source-analysis spark

spark ml 算法原理剖析以及具体的源码实现分析

项目最后更新:03/25/19

GitHub Stars

2.0K

Forks数量

815

贡献者数量

2

许可证

Apache-2.0

收录理由

大多数Spark ML的使用者只是调用fit()方法,然后信任默认参数。这份中文指南则面向那些想探究内部机制的人:它将每个算法背后的数学原理与Scala源码的逐行解读相结合,覆盖k-means、决策树、逻辑回归、ALS以及SVD/PCA在集群上真实分布运行的方式。它不是安装后即可调用的库,而是一份伴读材料。已经用上Spark的团队,在模型表现异常、需要调整默认参数,或者想要扩展现有的内置估计器时,会发现它很有参考价值。需要坦诚指出的是,这些讲解主要基于Spark 1.6.1,只有少部分涉及2.x,所以请把实现细节当作历史来读,并对照你当前的版本进行核实。这套结构同样适合作为自学大纲,或者用来帮助团队快速掌握分布式机器学习。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目