MLOps与评测
实验跟踪、部署、监控与模型评测等 MLOps 工具。
共 187 个项目
排名逻辑见 方法论 ;同类排名基于 GitHub 公开指标。
| 排名 | 项目 | Stars | Forks | 更新 | 许可证 |
|---|---|---|---|---|---|
| 101 |
elyra
Elyra 以AI为中心扩展JupyterLab。 |
2.0K | 369 | 08/19/26 | Apache-2.0 |
| 102 |
evaluate
🤗 Evaluate:一个用于轻松评估机器学习模型和数据集的库。 |
2.5K | 338 | 07/06/26 | Apache-2.0 |
| 103 |
katib
Kubernetes上的自动化机器学习 |
1.7K | 538 | 08/27/26 | Apache-2.0 |
| 104 |
AIF360
一套全面的公平性指标,用于数据集和机器学习模型,包含指标解释和缓解偏见算法。 |
2.9K | 912 | 06/15/26 | Apache-2.0 |
| 105 |
responsible-ai-toolbox
一套用于模型和数据探索与评估的工具,以支持负责任的人工智能。 |
1.8K | 494 | 08/28/26 | MIT |
| 106 |
mlrun
MLRun 是一个开源 MLOps 平台,用于快速构建和管理跨生命周期的持续 ML 应用。MLRun 集成到你的开发和 CI/CD 环境中,并自动化生产数据、ML 管道和在线应用的交付。 |
1.7K | 317 | 08/28/26 | Apache-2.0 |
| 107 |
expect
Expect 在真实浏览器中测试你的智能体代码 |
3.6K | 156 | 05/06/26 | Other |
| 108 |
tau2-bench
τ-Bench:现实世界领域中工具-智能体-用户交互的基准测试 |
1.9K | 480 | 08/27/26 | MIT |
| 109 |
WFGY
WFGY 正迈向 WFGY 5.0 Polaris 协议,这是一次面向 AI 推理、RAG、智能体及实际工作流的重要开源发布。包含问题地图、全局调试卡、WFGY 4.0 以及 CFV 彩蛋。 |
1.8K | 165 | 08/29/26 | Other |
| 110 |
InferenceX
开源连续推理基准研究平台,比较NVIDIA、AMD及未来TPU硬件上的领先LLM,提供实时仪表盘。 |
1.6K | 277 | 08/29/26 | Apache-2.0 |
| 111 |
training
MLPerf® 训练基准的参考实现 |
1.8K | 593 | 08/17/26 | Apache-2.0 |
| 112 |
hallucination-leaderboard
比较LLM在总结短文档时产生幻觉的表现排行榜 |
3.3K | 109 | 05/11/26 | Apache-2.0 |
| 113 |
claimed
CLAIMED 的目标是让低代码/无代码快速原型开发风格能够无缝地 CI/CD 到生产环境。 |
2.3K | 3.9K | 07/07/26 | Apache-2.0 |
| 114 |
VBench
[CVPR2024 Highlight] VBench - 我们评估视频生成 |
1.8K | 133 | 08/21/26 | Apache-2.0 |
| 115 |
openinference
OpenTelemetry插桩,用于AI可观测性 |
1.2K | 301 | 08/29/26 | Apache-2.0 |
| 116 |
evals-skills
AI Evals技能,以补充课程:AI Evals For Engineers & PMs |
1.7K | 170 | 08/16/26 | MIT |
| 117 |
CLUE
中文语言理解测评基准:数据集、基线、预训练模型、语料库和排行榜 |
4.3K | 544 | 02/06/26 | Other |
| 118 |
VectorDBBench
向量数据库基准测试 |
1.2K | 432 | 08/27/26 | MIT |
| 119 |
pycm
Python多分类混淆矩阵库 |
1.5K | 126 | 08/17/26 | MIT |
| 120 |
mlops-python-package
一个全面的Python包模板,助您快速启动并标准化MLOps计划与数据管道。 |
1.4K | 200 | 08/24/26 | MIT |