MLOps与评测

实验跟踪、部署、监控与模型评测等 MLOps 工具。

共 187 个项目

排名逻辑见 方法论 ;同类排名基于 GitHub 公开指标。

第 121–140 项,共 187 个

排名 项目 Stars Forks
121 skillsbench

SkillsBench 评估技能的工作效果以及智能体使用技能的有效性。

1.7K 363
122 AngelSlim

模型压缩工具包,致力于提升易用性、全面性和效率。

1.6K 174
123 waza

CLI / 框架,用于代理技能 - 创建、测试、衡量并提升技能质量与效果

1.3K 79
124 tensorwatch

用于Python机器学习和数据科学的调试、监控与可视化

3.5K 361
125 gemma-tuner-multimodal

使用PyTorch和Metal Performance Shaders在Apple Silicon上对Gemma 4和3n进行微调,支持音频、图像和文本。

1.5K 103
126 Skills

一个旨在提升大型语言模型技能的项目

1.0K 198
127 Tracely-ai

面向AI代理的基于追踪的CI/CD——生产故障自动转为回归测试,阻塞PR。自动检测、聚类、冻结为隔离用例,在CI中零成本重放。

1.2K 104
128 GraphGen

GraphGen:通过知识驱动的合成数据生成增强大语言模型的监督微调

1.2K 97
129 judgeval

智能体的持续改进栈。我们的环境数据和评估驱动智能体的改进与监控。

1.1K 96
130 AgentBench

全面评估LLM作为智能体的基准测试(ICLR'24)

3.7K 278
131 eli5

一个用于调试/检查机器学习分类器并解释其预测的库

2.8K 325
132 deepchecks

Deepchecks:机器学习模型与数据的持续验证测试。Deepchecks是全面的开源解决方案,满足所有AI与机器学习验证需求,支持从研究到生产全面测试数据和模型。

4.0K 304
133 sacred

Sacred 是一个工具,帮助你在 IDSIA 配置、组织、记录和复现实验。

4.4K 393
134 plexe

✨ 根据提示词构建机器学习模型

2.6K 255
135 finetrainers

可扩展且内存优化的扩散模型训练

1.4K 142
136 foolbox

一个Python工具箱,用于创建对抗性示例,以欺骗PyTorch、TensorFlow和JAX中的神经网络。

3.0K 442
137 keras-tuner

一个用于Keras的超参数调优库

2.9K 404
138 evaluation-guidebook

分享我们在管理 Open LLM Leaderboard 和设计 lighteval 时积累的关于 LLM 评估的实践见解和理论知识。

2.1K 126
139 alibi

用于解释机器学习模型的算法

2.6K 266
140 GongBU

论文被CIKM 2024接收。GongBU代码,一个用于领域特定适配的LLM微调平台。

1.2K 90
< 上一页
/ 10
下一页 >