#158 · 主分类: MLOps与评测

whylogs

ai-pipelines analytics approximate-statistics calculate-statistics constraints data-constraints data-pipeline data-quality data-science dataops dataset logging machine-learning ml-pipelines mlops model-performance python statistical-properties

一个用于机器学习模型和数据管道的开源数据日志库。📚 提供对数据质量和模型性能随时间变化的可见性。🛡️ 支持保护隐私的数据收集,确保安全与稳健性。📈

项目最后更新:01/10/25

GitHub Stars

2.8K

Forks数量

144

贡献者数量

28

许可证

Apache-2.0

收录理由

机器学习团队常常缺少一个轻量手段来回答最基础的可信度问题:今天进来的数据,其分布还和当初训练模型时一样吗?whylogs 通过为任意数据集生成紧凑的统计摘要(称为 profiles)来回应这个疑问,这些摘要记录分布、缺失值和自定义指标,却不必保存原始数据。多个 profiles 可以合并,因此你能够在分布式或流式负载下聚合它们,并比较任意时间窗口内的分布差异,让特征漂移、训练服务偏差和概念漂移的检测从一项定制工程变成日常检查。你还可以定义数据约束,在输入异常时快速失败;同一份 profiles 也能用于海量数据的探索性分析。对于不想引入重型监控平台、又希望在数据管道中获得可观测性的数据科学家、机器学习工程师和数据工程师来说,这是一个务实的起点,Python 与 Java 两套接口也让上手门槛保持在较低水平。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目