MLOps与评测

实验跟踪、部署、监控与模型评测等 MLOps 工具。

共 187 个项目

排名逻辑见 方法论 ;同类排名基于 GitHub 公开指标。

第 1–20 项,共 187 个

排名 项目 Stars Forks
1 unsloth

本地UI,用于运行和训练LLM及扩散模型。支持GGUF、MLX、Qwen3.8、Kimi K3、MiniMax-H3、Gemma 4、FLUX等。

75.2K 6.8K
2 LlamaFactory

统一高效微调100+大语言模型与视觉语言模型(ACL 2024)

74.4K 9.1K
3 airflow

Apache Airflow - 一个以编程方式编写、调度和监控工作流的平台

46.6K 17.7K
4 langfuse

🪢 开源AI工程平台:LLM评估、可观测性、指标、提示管理、游乐场、数据集。与OpenTelemetry、LangChain、OpenAI SDK、LiteLLM等集成。🍊YC W23

33.9K 3.7K
5 netron

神经网络、深度学习和机器学习模型的可视化工具

33.4K 3.2K
6 mlflow

面向代理、LLM和机器学习模型的开源AI工程平台。MLflow帮助各种规模的团队调试、评估、监控和优化生产级AI应用,同时控制成本并管理对模型和数据的访问。

27.7K 6.2K
7 heretic

全自动移除语言模型的审查

28.7K 3.2K
8 label-studio

Label Studio 是一个多类型数据标注和注释工具,具有标准化的输出格式。

28.2K 3.7K
9 shap

一种博弈论方法,用于解释任何机器学习模型的输出。

25.7K 3.7K
10 promptfoo

测试你的提示词、智能体和RAG。针对AI的红队/渗透测试/漏洞扫描。比较GPT、Claude、Gemini、DeepSeek等性能。简单的声明式配置,支持命令行和CI/CD集成。被OpenAI和Anthropic使用。

24.7K 2.2K
11 open-r1

完全开源复现DeepSeek-R1

26.4K 2.4K
12 datasets

🤗 面向AI模型的最大即用数据集中心,提供快速、易用且高效的数据处理工具

21.9K 3.4K
13 opik

调试、评估和监控您的LLM应用、RAG系统和代理工作流,提供全面的追踪、自动化评估和生产级仪表板。

21.7K 1.7K
14 openobserve

开源可观测性平台,支持日志、指标、追踪、前端监控、管道和LLM可观测性。作为Datadog、Splunk和Elasticsearch的复杂、简单且高性能替代方案,存储成本降低140倍,单二进制部署。

21.6K 1.1K
15 taipy

将数据和AI算法快速转化为生产就绪的Web应用程序。

19.4K 2.0K
16 argo-workflows

Kubernetes 工作流引擎

16.9K 3.6K
17 deepeval

LLM评估框架

18.0K 1.9K
18 evals

Evals是一个用于评估LLM和LLM系统的框架,也是一个开源的基准测试注册表。

19.3K 3.1K
19 ComfyUI-Manager

ComfyUI扩展,用于管理自定义节点,具有安装、移除、禁用、启用和中心功能。

16.0K 2.4K
20 dagster

用于数据资产开发、生产和观测的编排平台。

16.1K 2.3K
< 上一页
/ 10
下一页 >