Category

监控

当前分类下的文章。

监控 9 阅读

Prometheus 告警反复抖动:用 for、keep_firing_for 与规则测试稳定通知

## 适用场景 本文适用于 Prometheus 根据错误率、延迟、资源使用率等指标触发告警,并通过 Alertmanager 发送通知的场景。典型问题是:指标在阈值附近波动,告警几分钟内反复触发和恢复;短暂采集缺口被误判为恢复;值班人员收到大量重复通知,却难以判断故障是否真正结束。 目标不是简单地“把告警调迟”,

阅读全文