ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Keep:把告警风暴挡在前台的开源告警管理平台

Keep:把告警风暴挡在前台的开源告警管理平台 Keep把告警风暴挡在前台的开源告警管理平台【免费下载链接】keepThe open-source AIOps and alert management platform项目地址: https://gitcode.com/GitHub_Trending/kee/keep凌晨3点告警群涌进200条消息Prometheus报了CPU、Datadog报了延迟、Zabbix报了磁盘你知道它们八成是同一个问题但不知道从哪条看起。这类告警疲劳场景正是开源项目 Keep 要解决的——它把各监控工具推来的告警收进同一张表去重、关联、再触发自动化流程让值班的人只看该看的。Keep 是一个什么样的东西一句话Keep 像个告警前台。所有监控工具的告警先推给它它把重复的、零散的噪音滤掉归并成少量可读的告警条目再按你的规则自动往下分发建工单、发消息、执行脚本。官方对它的定位是 The open-source AIOps and alert management platform开源 AIOps 与告警管理平台核心卖点是单一视图、告警去重与关联、双向集成、工作流自动化。它不像 Prometheus 那样自己采集指标而是站在监控工具下游做收敛与自动化和你现有的监控栈不冲突。你的痛点 → Keep 怎么接住同一故障触发几十条告警看不过来→ 指纹去重 关联规则把同源告警归并成一条保留原始上下文告警散落在十几个系统里要来回切页面→ 所有告警进同一张表single pane of glass支持多维筛选、状态跟踪处理流程靠人肉看到告警→查→建单→通知→ 声明式工作流引擎触发条件 条件判断 多步动作全程自动化想排查根因但不知道服务间谁依赖谁→ 服务拓扑图从 Datadog、Grafana、ArgoCD 等工具自动画出依赖关系AI 能力想自己控制不想交 SaaS 费→ 工作流内可直接调用 OpenAI、Anthropic、Ollama 等含本地模型做告警摘要和富化最快部署方式一条命令拉起来默认是 docker-compose 起的三个服务后端 API、前端 UI、WebSocket 实时推送git clone https://gitcode.com/GitHub_Trending/kee/keep cd keep docker compose up -d浏览器打开http://localhost:3000就是告警界面。三步开始用接数据源在 Providers 页面添加你的监控系统比如 Prometheus、Datadog按提示配 webhook 或拉取凭证每个 provider 都自带预置的告警格式解析和去重规则看第一条告警告警推来后会出现在告警表里可以按严重度、服务、状态筛选写第一条工作流用 YAML 声明触发条件和动作比如critical 告警来了就发 Slack 并建 Jira 工单官方在 examples/workflows/ 里放了一百多个可直接抄的例子生产环境的话docs/deployment/ 下还有 KubernetesHelm Chart、带 Redis 异步队列ARQ的高吞吐配置等方案。告警去重怎么配替你解决什么同一台服务故障多个工具、多个副本各报一条通知群瞬间刷屏。核心机制给每条告警算一个指纹指纹相同的告警归并成一条而不是简单丢弃。你能配什么详见 docs/overview/deduplication.mdx部分去重默认指定哪些字段参与指纹如serviceerror_message命中即归并每条 provider 都预置了针对其告警格式的指纹字段可直接用完全去重除忽略字段外所有字段相同才算重复用于挡掉完全一样的重复推送比如每5分钟重发一次的相同告警两种模式可叠加忽略字段可自由指定告警自动化工作流怎么写替你解决什么看到告警 → 查上下文 → 通知相关人 → 建工单这套动作半夜还得靠人。核心机制YAML 声明式工作流 触发器triggers 步骤/动作steps/actions 条件判断conditions告警进来就按声明自动跑。你能配什么触发器告警事件可带 CEL 条件过滤、定时、手动条件阈值比较、断言、上一步结果判断写复杂逻辑不用拼 shell动作调任意已接入的 provider——发消息Slack/Teams/Telegram/邮件、建工单Jira/ServiceNow/Asana、执行 HTTP 请求、跑脚本、甚至调 LLM 做告警摘要支持循环、变量、上下文透传写法参考 docs/workflows/官方示例里就有一批典型套路告警来了先判断是不是业务时间businesshours.yml、按 CEL 匹配再分派complex-conditions-cel.yml、失败时自动降级通知send_slack_message_on_failure.yaml照抄改配置即可。服务拓扑怎么用替你解决什么根因排查时上游挂了下游肯定报这事得靠脑内地图新人尤其抓瞎。核心机制从已接入的工具Datadog、PagerDuty、ArgoCD、Grafana、Cilium 等拉取服务依赖关系自动渲染成拓扑图。你能配什么节点服务/组件边依赖关系图上直接反映各节点健康状态出故障时顺着边就能看到影响传播路径。数据源接得越多图越完整支持的工具列表见 docs/overview/servicetopology.mdx。能对接哪些工具源码里目前有 130 个 provider按类别挑代表性的看完整清单在 docs/providers/类别代表工具集成方式指标/监控Prometheus、Grafana、Zabbix、Checkmk、Netdata、CloudWatch、Datadog、AppDynamicsWebhook 推送 / API 拉取日志Elasticsearch、Grafana Loki、Graylog、Splunk、VictoriaLogs查询 告警接入容器/K8sKubernetes、AKS/EKS/GKE、OpenShift、ArgoCD、FluxCD原生 API工单/事件PagerDuty、Jira、ServiceNow、Asana、Linear、Trello、Redmine双向同步通知渠道Slack、Teams、Telegram、Discord、SMTP、Webhook、ntfy消息推送AI 后端OpenAI、Anthropic、DeepSeek、Ollama、Llama.cpp本地模型工作流内调用做摘要/富化大部分 provider 支持双向既能把告警收进来也能作为动作的目标发出去比如在 PagerDuty 侧关闭告警。Before / After 对照以下为一篇用户场景文章给出的参考量级实际效果取决于你的告警规则质量和接入完整度指标接入前典型场景接入 Keep 后变化团队每天需人看的告警5000 条约 500 条减少 90%平均响应时间45 分钟约 5 分钟减少 89%MTTR120 分钟约 30 分钟减少 75%误报/重复通知占比40%约 8%减少 80%一个案例背景-动作-结果某电商平台大促期间峰值日告警 20000接入 Keep 后配置告警聚合规则 自动化扩容工作流告警量下降约 85%数据库故障的响应时间从 15 分钟降到 30 秒级。避坑与选型建议适合监控工具 ≥2 套告警散落在各系统需要一个统一收敛层已经有值班流程想把通知/建单/恢复这类重复动作自动化团队规模小到中用不起 BigPanda、Splunk ITSI 这类商业 AIOps或想先用开源自建不建议只有一套监控、日均告警就几十条——直接看源头即可引入 Keep 是给自己加一层期望它替你采集指标/画监控面板——它不采集数据只管告警的收敛和自动化PrometheusGrafana 这套还得保留常见坑AI 关联引擎不开源。自动把未分配告警聚类进事件的 AI correlation 是 Cloud/企业版功能见 docs/overview/ai-correlation.mdx开源版能做的是规则式去重/关联 工作流里自己调 LLM。选型时别被AI 告警关联的演示图误导。去重指纹字段要调。默认的预置指纹不一定贴合你的告警字段命名字段配多了合不起来、配少了会误合并建议先开部分去重观察几天再收紧。它是有状态服务。告警、provider 配置、工作流都存在本地默认 state 目录/数据库升级和迁移前记得备份生产部署参考 docs/deployment/ 里的持久化方案。更多资源官方文档docs/核心源码keep/providers、workflow 引擎、API 都在这个目录可抄的工作流示例examples/workflows/先在测试机上docker compose up -d跑起来接一个你现有最吵的监控源进去看一天去重前后的告警量差比看任何介绍都直观。【免费下载链接】keepThe open-source AIOps and alert management platform项目地址: https://gitcode.com/GitHub_Trending/kee/keep创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表