MLOps与评测

实验跟踪、部署、监控与模型评测等 MLOps 工具。

共 187 个项目

排名逻辑见 方法论 ;同类排名基于 GitHub 公开指标。

第 101–120 项,共 187 个

排名 项目 Stars Forks
101 elyra

Elyra 以AI为中心扩展JupyterLab。

2.0K 369
102 evaluate

🤗 Evaluate:一个用于轻松评估机器学习模型和数据集的库。

2.5K 338
103 katib

Kubernetes上的自动化机器学习

1.7K 538
104 AIF360

一套全面的公平性指标,用于数据集和机器学习模型,包含指标解释和缓解偏见算法。

2.9K 912
105 responsible-ai-toolbox

一套用于模型和数据探索与评估的工具,以支持负责任的人工智能。

1.8K 494
106 mlrun

MLRun 是一个开源 MLOps 平台,用于快速构建和管理跨生命周期的持续 ML 应用。MLRun 集成到你的开发和 CI/CD 环境中,并自动化生产数据、ML 管道和在线应用的交付。

1.7K 317
107 expect

Expect 在真实浏览器中测试你的智能体代码

3.6K 156
108 tau2-bench

τ-Bench:现实世界领域中工具-智能体-用户交互的基准测试

1.9K 480
109 WFGY

WFGY 正迈向 WFGY 5.0 Polaris 协议,这是一次面向 AI 推理、RAG、智能体及实际工作流的重要开源发布。包含问题地图、全局调试卡、WFGY 4.0 以及 CFV 彩蛋。

1.8K 165
110 InferenceX

开源连续推理基准研究平台,比较NVIDIA、AMD及未来TPU硬件上的领先LLM,提供实时仪表盘。

1.6K 277
111 training

MLPerf® 训练基准的参考实现

1.8K 593
112 hallucination-leaderboard

比较LLM在总结短文档时产生幻觉的表现排行榜

3.3K 109
113 claimed

CLAIMED 的目标是让低代码/无代码快速原型开发风格能够无缝地 CI/CD 到生产环境。

2.3K 3.9K
114 VBench

[CVPR2024 Highlight] VBench - 我们评估视频生成

1.8K 133
115 openinference

OpenTelemetry插桩,用于AI可观测性

1.2K 301
116 evals-skills

AI Evals技能,以补充课程:AI Evals For Engineers & PMs

1.7K 170
117 CLUE

中文语言理解测评基准:数据集、基线、预训练模型、语料库和排行榜

4.3K 544
118 VectorDBBench

向量数据库基准测试

1.2K 432
119 pycm

Python多分类混淆矩阵库

1.5K 126
120 mlops-python-package

一个全面的Python包模板,助您快速启动并标准化MLOps计划与数据管道。

1.4K 200
< 上一页
/ 10
下一页 >