#49 · 主分类: AI运维与SRE工具
nvidia_gpu_exporter
Nvidia GPU导出器,用于Prometheus,使用nvidia-smi二进制或NVML
项目最后更新:08/28/26
GitHub Stars
1.5K
Forks数量
154
贡献者数量
17
许可证
MIT
收录理由
当你的GPU服务器在后台默默运转、状态难以及时掌握时,这个导出器能让它们变得一目了然。它作为一个轻量的Prometheus导出器,从NVIDIA显卡上采集利用率、显存、功耗和温度,并以可抓取的指标形式暴露出来,还附带了官方Grafana仪表盘,支持单卡和多卡视图。它的实用之处在于依赖nvidia-smi二进制文件而非底层驱动接口,因此能在Windows、消费级GeForce/RTX显卡、vGPU虚拟机以及受限容器中运行,这些场景往往让数据中心级工具无从下手。正因如此,它成为家庭实验室和小型集群的天然选择,可以跳过重量级的NVIDIA GPU Operator,也能在新旧显卡混用的环境中保持统一表现。实验性的NVML后端在Linux上提供了MIG实例指标、XID错误、能量计数器和PCIe吞吐量,且不会改变现有指标名称,已有的仪表盘照常工作。如果你在数据中心显卡上已经部署了GPU Operator,DCGM-exporter或许更合适,但对其他绝大多数场景而言,这是一个能让你在训练和推理时真正看清GPU实际状态的务实方案。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
harness
Harness 开源是一个端到端的开发者平台,具有源代码管理、CI/CD 流水线、托管开发环境和制品仓库。
nx
Nx 是单体仓库平台,赋能开发者和 AI 代理。它优化构建、扩展 CI,并自动修复失败的 PR,将交付时间缩短一半。
jenkins
Jenkins 自动化服务器
awx
AWX 提供基于 Web 的用户界面、REST API 和基于 Ansible 的任务引擎,是 Red Hat Ansible Automation Platform 的上游项目之一。
dagger
自动化引擎,用于构建、测试和交付任何代码库,支持本地、CI或云端运行。