#48 · 主分类: AI运维与SRE工具

gpu-hot

charts cuda dashboard devops docker flask gpu gpu-monitoring llm mlops nvidia nvidia-docker nvidia-smi python real-time real-time-monitoring system-monitoring

🔥 实时 NVIDIA GPU 仪表盘

项目最后更新:08/25/26

GitHub Stars

1.6K

Forks数量

82

贡献者数量

8

许可证

MIT

收录理由

GPU Hot 把 nvidia-smi 搬进了浏览器,打开网页就能看到每张 NVIDIA 显卡的实时状态,省去挨台 SSH 上去敲命令的麻烦。它能以亚秒级刷新率展示利用率、显存、温度、功耗、时钟频率、PCIe 信息以及降频状态,同时列出正在运行的进程和 PID,一眼就能找出是哪个训练任务在抢占 GPU 资源。同一个 Docker 镜像既能管单机也能管集群:每台 GPU 服务器上跑一个实例,再用一个无需 GPU 的 hub 节点指向这些服务器,就能在一个面板上纵览整个集群的负载情况,部署时除了容器本身不需要额外配置。对 ML 工程师和运维来说,想在大模型长时间训练中及早发现显卡异常、避免训练中断,又不想引入笨重的监控系统,这个轻量工具很实用。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目