#57 · 主分类: AI运维与SRE工具

ongrid

ai-agents aiops alerting chatops devops golang grafana incident-response kubernetes llm llm-agent mcp monitoring observability opentelemetry prometheus rag root-cause-analysis self-hosted sre

一个运维AI智能体,能够理解你的基础设施,找到根本原因并修复它——直接通过Slack、Telegram、Lark或钉钉。

项目最后更新:08/28/26

GitHub Stars

931

Forks数量

201

贡献者数量

18

许可证

AGPL-3.0

收录理由

Ongrid 走了一条不同的故障响应路线:收到告警后,它不是先去找人,而是自己开始排查。接入 Prometheus、Grafana、OpenTelemetry 和 Kubernetes 之后,一个告警会触发对指标、日志、链路和拓扑的自动巡检,同时把可能的根因和从 RAG 知识库中检索到的相关 runbook 一起摆出来。它还能搜索代码并远程执行修复,另有专门针对不同领域的子代理和技能。你可以直接在 Slack、Telegram、Lark 或钉钉里指挥它干活。由于用 Go 编写且支持自托管,SRE 或平台团队可以把整套系统放在自己的基础设施内部运行,不必依赖外部供应商。这正是它区别于那些只是把仪表盘包一层聊天界面的工具的地方。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目