跳转至

可观测平台运维与排障

监控系统失效时,业务可能仍在故障但没人收到告警。因此要独立监控采集成功率、写入队列、规则评估、查询延迟、通知链路和存储容量。

每日健康检查

环节 关键状态
采集 Target/Agent 在线率、抓取错误、采集延迟
传输 Remote Write/OTLP 队列、重试、丢弃、出口流量
存储 写入速率、磁盘、保留、压缩、复制、索引健康
查询 P95/P99 延迟、超时、大查询和并发
规则 评估失败、耗时、漏执行、规则版本
通知 Alertmanager 集群、通知失败、端到端测试告警

数据“消失”的排障路线

数据源是否产生
  → Agent/Exporter 是否读取
  → 服务发现和标签是否正确
  → 发送队列是否积压/丢弃
  → 后端是否写入并在保留期内
  → 查询的数据源、时间范围、标签和租户是否正确

不要一看到 Grafana 无数据就重启 Grafana。Grafana 主要负责查询和展示,数据往往丢在采集、网络、认证、标签或存储环节。

容量与基数

  • 监控活跃时序、每日新增日志、Span 速率和每个租户占用。
  • 找出高基数 metric/label、日志字段和 Trace attribute。
  • 限制查询时间范围、并发和返回数据量。
  • 调整保留或采样前评估合规和排障窗口。
  • 磁盘扩容不能替代基数治理和数据生命周期管理。

变更与恢复

规则、Dashboard、数据源和 Collector 配置全部进入 Git,变更前做语法检查和测试环境验证。备份内容包括规则、Dashboard/Folder、数据源配置、访问控制、静默状态(按需求)以及后端数据恢复方案。

升级时确认数据格式、API、插件、Agent/Collector 与后端兼容性;先灰度一部分采集链路,观察丢弃、延迟和资源,再扩大范围。

端到端演练

定期产生一条测试指标/日志/Trace 和测试告警,验证:

产生 → 采集 → 存储 → 查询 → 规则 → Alertmanager → 通知 → 值班确认

组件各自显示 Healthy 不代表整条链路可用,只有端到端测试能证明告警真正能到达人。