MLOps与评测
实验跟踪、部署、监控与模型评测等 MLOps 工具。
共 187 个项目
排名逻辑见 方法论 ;同类排名基于 GitHub 公开指标。
| 排名 | 项目 | Stars | Forks | 更新 | 许可证 |
|---|---|---|---|---|---|
| 81 |
Soup
从一个YAML文件微调LLM。Layer streaming在4GB笔记本GPU上训练8B模型。 |
3.6K | 551 | 08/29/26 | Apache-2.0 |
| 82 |
langwatch
LLM评估和AI代理测试平台 |
3.5K | 356 | 08/29/26 | Apache-2.0 |
| 83 |
evalscope
一个精简且可定制的框架,用于高效的大模型(LLM、VLM、AIGC)评估和性能基准测试。 |
3.3K | 471 | 08/28/26 | Apache-2.0 |
| 84 |
sagemaker-python-sdk
一个用于在Amazon SageMaker上训练和部署机器学习模型的库 |
2.3K | 1.3K | 08/28/26 | Apache-2.0 |
| 85 |
shapash
🔅 Shapash:用户友好的可解释性和可解释性,用于开发可靠且透明的机器学习模型 |
3.3K | 388 | 08/28/26 | Apache-2.0 |
| 86 |
lit
学习可解释性工具:以可扩展且框架无关的界面,交互式分析机器学习模型以理解其行为。 |
3.7K | 369 | 07/29/26 | Apache-2.0 |
| 87 |
lmnr
Laminar - 专为AI智能体设计的开源可观测性平台。YC S24。 |
3.2K | 228 | 08/29/26 | Apache-2.0 |
| 88 |
OSWorld
[NeurIPS 2024] OSWorld:在真实计算机环境中对多模态智能体进行开放式任务的基准测试 |
3.1K | 529 | 08/21/26 | Apache-2.0 |
| 89 |
llm-datasets
精选的后训练数据集和工具列表。 |
4.8K | 394 | 04/29/26 | Other |
| 90 |
openlit
AI 工程开源平台:原生 OpenTelemetry 的 LLM 可观测性、GPU 监控、护栏、评估、提示管理、保险库、游乐场。🚀💻 集成 50+ LLM 提供商、向量数据库、代理框架和 GPU。 |
2.7K | 366 | 08/29/26 | Apache-2.0 |
| 91 |
trainer
基于Kubernetes的分布式AI模型训练与LLM微调 |
2.2K | 1.0K | 08/29/26 | Apache-2.0 |
| 92 |
hamilton
Apache Hamilton 帮助数据科学家和工程师定义可测试、模块化、自文档化的数据流,这些数据流编码了血缘/追踪和元数据。在 Python 运行的任何地方都能运行和扩展。 |
2.6K | 213 | 08/19/26 | Apache-2.0 |
| 93 |
maestro
简化多模态模型的微调流程:PaliGemma 2、Florence-2 和 Qwen2.5-VL |
2.7K | 223 | 08/24/26 | Apache-2.0 |
| 94 |
inspector
用于聊天、检查和调试MCP服务器、MCP应用及ChatGPT应用的测试与评估平台。 |
2.2K | 271 | 08/29/26 | Other |
| 95 |
fairlearn
一个用于评估和改进机器学习模型公平性的Python包。 |
2.3K | 515 | 08/24/26 | MIT |
| 96 |
tfx
TFX 是一个用于部署生产级机器学习流水线的端到端平台。 |
2.2K | 725 | 08/17/26 | Apache-2.0 |
| 97 |
llm-foundry
用于Databricks基础模型的LLM训练代码 |
4.4K | 590 | 03/25/26 | Apache-2.0 |
| 98 |
EvalAI
:cloud: :rocket: :bar_chart: :chart_with_upwards_trend: 评估人工智能的最新水平 |
2.0K | 983 | 08/29/26 | Other |
| 99 |
cube-studio
cubestudio开源云原生一站式机器学习/深度学习/大模型AI平台/MaaS/mlops/人工智能平台/训推平台,算法全链路流程,多租户,算力租赁平台,token中转,拖拉拽任务流pipeline编排,多机多卡分布式训练,超参搜索,推理服务,VGPU虚拟化,云边端协同,边缘计算,自动化标注平台,deepseek等大模型sft微调/奖励模型/强化学习训练,vllm/ollama/mindie大模型多机推理,私有知识库llmops智能体,AI模型市场,支持国产异构算力调度,昇腾/寒武纪/海光/摩尔/沐曦等,支持ib/roce/RDMA,信创支持 |
2.5K | 198 | 08/17/26 | Other |
| 100 |
future-agi
开源的端到端平台,用于评估、观察和改进LLM及AI代理应用。追踪·评估·模拟·数据集·网关·护栏。可自托管。Apache 2.0。 |
1.9K | 562 | 08/30/26 | Apache-2.0 |