#34 · 主分类: AI运维与SRE工具

holmesgpt

aiops chatbot chatops devops devops-tools incident incident-management incident-response jira kubernetes llm llm-agent llm-framework llms monitoring observability prometheus site-reliability-engineering slack sre

SRE智能体 - CNCF沙盒项目

项目最后更新:08/26/26

GitHub Stars

3.2K

Forks数量

457

贡献者数量

74

许可证

Apache-2.0

收录理由

排查生产故障时,运维人员往往要在仪表盘、日志和告警之间来回切换,手动拼凑线索。HolmesGPT 把这套流程自动化了:它能接入你的可观测性系统、Kubernetes、云平台和数据库,主动拉取相关指标与日志,直奔根因分析,而不是只给你一张状态页。它的 Operator 模式会在后台全天候运行,赶在用户发现之前察觉异常,并可通过 Slack 通知你,甚至直接提交 Pull Request 来应用修复。调查结果还能写回 Jira、PagerDuty 或 OpsGenie,让整个流程无缝嵌入现有的值班体系。对于希望 LLM 代理真正在真实基础设施中干活、而不是停留在实验环境里的 SRE 和平台团队,这个项目值得拿自己的历史故障数据来试一试。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目