MLOps与评测

实验跟踪、部署、监控与模型评测等 MLOps 工具。

共 187 个项目

排名逻辑见 方法论 ;同类排名基于 GitHub 公开指标。

第 81–100 项,共 187 个

排名 项目 Stars Forks
81 Soup

从一个YAML文件微调LLM。Layer streaming在4GB笔记本GPU上训练8B模型。

3.6K 551
82 langwatch

LLM评估和AI代理测试平台

3.5K 356
83 evalscope

一个精简且可定制的框架,用于高效的大模型(LLM、VLM、AIGC)评估和性能基准测试。

3.3K 471
84 sagemaker-python-sdk

一个用于在Amazon SageMaker上训练和部署机器学习模型的库

2.3K 1.3K
85 shapash

🔅 Shapash:用户友好的可解释性和可解释性,用于开发可靠且透明的机器学习模型

3.3K 388
86 lit

学习可解释性工具:以可扩展且框架无关的界面,交互式分析机器学习模型以理解其行为。

3.7K 369
87 lmnr

Laminar - 专为AI智能体设计的开源可观测性平台。YC S24。

3.2K 228
88 OSWorld

[NeurIPS 2024] OSWorld:在真实计算机环境中对多模态智能体进行开放式任务的基准测试

3.1K 529
89 llm-datasets

精选的后训练数据集和工具列表。

4.8K 394
90 openlit

AI 工程开源平台:原生 OpenTelemetry 的 LLM 可观测性、GPU 监控、护栏、评估、提示管理、保险库、游乐场。🚀💻 集成 50+ LLM 提供商、向量数据库、代理框架和 GPU。

2.7K 366
91 trainer

基于Kubernetes的分布式AI模型训练与LLM微调

2.2K 1.0K
92 hamilton

Apache Hamilton 帮助数据科学家和工程师定义可测试、模块化、自文档化的数据流,这些数据流编码了血缘/追踪和元数据。在 Python 运行的任何地方都能运行和扩展。

2.6K 213
93 maestro

简化多模态模型的微调流程:PaliGemma 2、Florence-2 和 Qwen2.5-VL

2.7K 223
94 inspector

用于聊天、检查和调试MCP服务器、MCP应用及ChatGPT应用的测试与评估平台。

2.2K 271
95 fairlearn

一个用于评估和改进机器学习模型公平性的Python包。

2.3K 515
96 tfx

TFX 是一个用于部署生产级机器学习流水线的端到端平台。

2.2K 725
97 llm-foundry

用于Databricks基础模型的LLM训练代码

4.4K 590
98 EvalAI

:cloud: :rocket: :bar_chart: :chart_with_upwards_trend: 评估人工智能的最新水平

2.0K 983
99 cube-studio

cubestudio开源云原生一站式机器学习/深度学习/大模型AI平台/MaaS/mlops/人工智能平台/训推平台,算法全链路流程,多租户,算力租赁平台,token中转,拖拉拽任务流pipeline编排,多机多卡分布式训练,超参搜索,推理服务,VGPU虚拟化,云边端协同,边缘计算,自动化标注平台,deepseek等大模型sft微调/奖励模型/强化学习训练,vllm/ollama/mindie大模型多机推理,私有知识库llmops智能体,AI模型市场,支持国产异构算力调度,昇腾/寒武纪/海光/摩尔/沐曦等,支持ib/roce/RDMA,信创支持

2.5K 198
100 future-agi

开源的端到端平台,用于评估、观察和改进LLM及AI代理应用。追踪·评估·模拟·数据集·网关·护栏。可自托管。Apache 2.0。

1.9K 562
< 上一页
/ 10
下一页 >