#57 · 主分类: AI运维与SRE工具
ongrid
一个运维AI智能体,能够理解你的基础设施,找到根本原因并修复它——直接通过Slack、Telegram、Lark或钉钉。
项目最后更新:08/28/26
GitHub Stars
931
Forks数量
201
贡献者数量
18
许可证
AGPL-3.0
收录理由
Ongrid 走了一条不同的故障响应路线:收到告警后,它不是先去找人,而是自己开始排查。接入 Prometheus、Grafana、OpenTelemetry 和 Kubernetes 之后,一个告警会触发对指标、日志、链路和拓扑的自动巡检,同时把可能的根因和从 RAG 知识库中检索到的相关 runbook 一起摆出来。它还能搜索代码并远程执行修复,另有专门针对不同领域的子代理和技能。你可以直接在 Slack、Telegram、Lark 或钉钉里指挥它干活。由于用 Go 编写且支持自托管,SRE 或平台团队可以把整套系统放在自己的基础设施内部运行,不必依赖外部供应商。这正是它区别于那些只是把仪表盘包一层聊天界面的工具的地方。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
harness
Harness 开源是一个端到端的开发者平台,具有源代码管理、CI/CD 流水线、托管开发环境和制品仓库。
nx
Nx 是单体仓库平台,赋能开发者和 AI 代理。它优化构建、扩展 CI,并自动修复失败的 PR,将交付时间缩短一半。
jenkins
Jenkins 自动化服务器
awx
AWX 提供基于 Web 的用户界面、REST API 和基于 Ansible 的任务引擎,是 Red Hat Ansible Automation Platform 的上游项目之一。
dagger
自动化引擎,用于构建、测试和交付任何代码库,支持本地、CI或云端运行。