#155 · 主分类: MLOps与评测
labml
🔎 从手机监控深度学习模型训练和硬件使用情况 📱
项目最后更新:04/10/25
GitHub Stars
2.3K
Forks数量
152
贡献者数量
9
许可证
MIT
收录理由
长时间的训练任务,最怕的就是中途出状况却浑然不知。labml 这个工具能让你用手机随时瞄一眼模型跑到哪了、硬件吃不吃得消。它只需在 PyTorch、TensorFlow 或 Keras 的训练循环里加几行代码,就能把 loss、准确率以及 GPU、CPU 的负载这些实时指标,推送到一个网页面板上,手机或笔记本打开就能看。同一个包还会把 git 提交、配置和超参数等实验元数据一并记下来,方便你日后追溯某次结果到底是怎么跑出来的。分布式训练时,只要在多台机器上共用同一个实验 ID,就能把各节点的状态汇总到一起,多卡环境用起来很顺手。对于不想依赖云端托管、希望自己掌控实验记录,或者只想用一条命令快速盯一下某台机器硬件状况的团队来说,它的部署很直接,MIT 许可也让人省心。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
unsloth
本地UI,用于运行和训练LLM及扩散模型。支持GGUF、MLX、Qwen3.8、Kimi K3、MiniMax-H3、Gemma 4、FLUX等。
LlamaFactory
统一高效微调100+大语言模型与视觉语言模型(ACL 2024)
airflow
Apache Airflow - 一个以编程方式编写、调度和监控工作流的平台
langfuse
🪢 开源AI工程平台:LLM评估、可观测性、指标、提示管理、游乐场、数据集。与OpenTelemetry、LangChain、OpenAI SDK、LiteLLM等集成。🍊YC W23
netron
神经网络、深度学习和机器学习模型的可视化工具