可观测平台运维与排障¶
监控系统失效时,业务可能仍在故障但没人收到告警。因此要独立监控采集成功率、写入队列、规则评估、查询延迟、通知链路和存储容量。
每日健康检查¶
| 环节 | 关键状态 |
|---|---|
| 采集 | Target/Agent 在线率、抓取错误、采集延迟 |
| 传输 | Remote Write/OTLP 队列、重试、丢弃、出口流量 |
| 存储 | 写入速率、磁盘、保留、压缩、复制、索引健康 |
| 查询 | P95/P99 延迟、超时、大查询和并发 |
| 规则 | 评估失败、耗时、漏执行、规则版本 |
| 通知 | Alertmanager 集群、通知失败、端到端测试告警 |
数据“消失”的排障路线¶
不要一看到 Grafana 无数据就重启 Grafana。Grafana 主要负责查询和展示,数据往往丢在采集、网络、认证、标签或存储环节。
容量与基数¶
- 监控活跃时序、每日新增日志、Span 速率和每个租户占用。
- 找出高基数 metric/label、日志字段和 Trace attribute。
- 限制查询时间范围、并发和返回数据量。
- 调整保留或采样前评估合规和排障窗口。
- 磁盘扩容不能替代基数治理和数据生命周期管理。
变更与恢复¶
规则、Dashboard、数据源和 Collector 配置全部进入 Git,变更前做语法检查和测试环境验证。备份内容包括规则、Dashboard/Folder、数据源配置、访问控制、静默状态(按需求)以及后端数据恢复方案。
升级时确认数据格式、API、插件、Agent/Collector 与后端兼容性;先灰度一部分采集链路,观察丢弃、延迟和资源,再扩大范围。
端到端演练¶
定期产生一条测试指标/日志/Trace 和测试告警,验证:
组件各自显示 Healthy 不代表整条链路可用,只有端到端测试能证明告警真正能到达人。