- 0
- 0
- 约4.44千字
- 约 8页
- 2026-10-09 发布于江苏
- 举报
一体化监控告警体系设计与SLO治理方案实例
(软件研发技术文档·数据与实例为据)
第一章监控现状与体系建设目标
某在线支付平台200个微服务、日均指标采样38亿个点。此前监控烟囱化,指标、日志、链路三套割裂,故障定位靠人翻多个面板。一次资损故障平均耗时47分钟才定位,其中告警本身占9分钟、根因判断占38分钟。体系建设目标定为从“出事看得见”升级为“该管才打扰”。
目标拆为四量:告警准确率(触发后确为真故障)≥80%、告警噪声率(无效告警占比)≤15%、故障平均发现时间≤1分钟、核心服务SLO达标率≥99.9%。为此引入SLO(服务水平目标)作为告警的核心依据,把阈值从拍脑袋改为按用户影响设定。
表1-1体系建设目标
指标
现状
目标
口径
周期
告警准确率
32%
≥80%
真故障/总告警
月度
噪声率
58%
≤15%
无效告警占比
周度
平均发现时间
9分钟
≤1分钟
MTTD
按事件
SLO达标率
无度量
99.9%
成功请求/总
滚动30天
第二章SLI/SLO/错误预算定义
SLI是客观度量指标,选定可用性(成功请求占比)与延迟P99。SLO是给SLI定的目标,如核心支付接口可用性SLO定为99.95%、P99延迟SLO定为300毫秒。SLO不是越高越好,99.95%允许每月约22分钟不可用,定得过高等于向团队承诺做不到的数、只会催生告警疲劳。
错误预算是100
原创力文档

文档评论(0)