MLOps与评测
实验跟踪、部署、监控与模型评测等 MLOps 工具。
共 187 个项目
排名逻辑见 方法论 ;同类排名基于 GitHub 公开指标。
| 排名 | 项目 | Stars | Forks | 更新 | 许可证 |
|---|---|---|---|---|---|
| 121 |
skillsbench
SkillsBench 评估技能的工作效果以及智能体使用技能的有效性。 |
1.7K | 363 | 07/23/26 | Apache-2.0 |
| 122 |
AngelSlim
模型压缩工具包,致力于提升易用性、全面性和效率。 |
1.6K | 174 | 08/07/26 | Other |
| 123 |
waza
CLI / 框架,用于代理技能 - 创建、测试、衡量并提升技能质量与效果 |
1.3K | 79 | 08/29/26 | MIT |
| 124 |
tensorwatch
用于Python机器学习和数据科学的调试、监控与可视化 |
3.5K | 361 | 03/30/26 | MIT |
| 125 |
gemma-tuner-multimodal
使用PyTorch和Metal Performance Shaders在Apple Silicon上对Gemma 4和3n进行微调,支持音频、图像和文本。 |
1.5K | 103 | 08/13/26 | MIT |
| 126 |
Skills
一个旨在提升大型语言模型技能的项目 |
1.0K | 198 | 08/28/26 | Apache-2.0 |
| 127 |
Tracely-ai
面向AI代理的基于追踪的CI/CD——生产故障自动转为回归测试,阻塞PR。自动检测、聚类、冻结为隔离用例,在CI中零成本重放。 |
1.2K | 104 | 08/29/26 | MIT |
| 128 |
GraphGen
GraphGen:通过知识驱动的合成数据生成增强大语言模型的监督微调 |
1.2K | 97 | 08/17/26 | Apache-2.0 |
| 129 |
judgeval
智能体的持续改进栈。我们的环境数据和评估驱动智能体的改进与监控。 |
1.1K | 96 | 08/24/26 | Apache-2.0 |
| 130 |
AgentBench
全面评估LLM作为智能体的基准测试(ICLR'24) |
3.7K | 278 | 02/08/26 | Apache-2.0 |
| 131 |
eli5
一个用于调试/检查机器学习分类器并解释其预测的库 |
2.8K | 325 | 04/08/26 | MIT |
| 132 |
deepchecks
Deepchecks:机器学习模型与数据的持续验证测试。Deepchecks是全面的开源解决方案,满足所有AI与机器学习验证需求,支持从研究到生产全面测试数据和模型。 |
4.0K | 304 | 12/28/25 | Other |
| 133 |
sacred
Sacred 是一个工具,帮助你在 IDSIA 配置、组织、记录和复现实验。 |
4.4K | 393 | 10/22/25 | MIT |
| 134 |
plexe
✨ 根据提示词构建机器学习模型 |
2.6K | 255 | 03/06/26 | Apache-2.0 |
| 135 |
finetrainers
可扩展且内存优化的扩散模型训练 |
1.4K | 142 | 05/26/26 | Apache-2.0 |
| 136 |
foolbox
一个Python工具箱,用于创建对抗性示例,以欺骗PyTorch、TensorFlow和JAX中的神经网络。 |
3.0K | 442 | 12/03/25 | MIT |
| 137 |
keras-tuner
一个用于Keras的超参数调优库 |
2.9K | 404 | 12/01/25 | Apache-2.0 |
| 138 |
evaluation-guidebook
分享我们在管理 Open LLM Leaderboard 和设计 lighteval 时积累的关于 LLM 评估的实践见解和理论知识。 |
2.1K | 126 | 12/03/25 | Other |
| 139 |
alibi
用于解释机器学习模型的算法 |
2.6K | 266 | 10/17/25 | Other |
| 140 |
GongBU
论文被CIKM 2024接收。GongBU代码,一个用于领域特定适配的LLM微调平台。 |
1.2K | 90 | 01/22/26 | MIT |