#41 · 主分类: 经典机器学习框架
mrmr
mRMR(最小冗余-最大相关性)用于大规模自动特征选择。
项目最后更新:11/19/24
GitHub Stars
629
Forks数量
90
贡献者数量
9
许可证
MIT
收录理由
多数特征选择方法会把所有与目标变量沾边的特征都挑出来,结果留下一大堆列让你自己慢慢筛。mRMR 的思路正好相反:它只找那个仍然保留预测信息的最小特征子集,每选一个特征,都看它在其他特征之外还能贡献多少独有价值。这种“最小最优”的特性,对需要在训练前压缩宽表的团队特别实用——列数少了,内存占用低,运行更快,模型也更好解释。同一套选择逻辑,分类目标和数值目标各有一个函数,而且能跑在 Pandas、Polars、Spark 和 Google BigQuery 上,不管数据是本地 DataFrame 还是分布式数仓,用法完全一致。Uber 工程师在 2019 年发表的论文里就描述了如何把 mRMR 用在他们营销机器学习平台上。对于经常要在杂乱宽表上重建模型的数据科学家来说,这算是把原本手工完成的步骤自动化的一条直路。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。