可能,而且这是回落诊断里最容易被误判的一种。判断的关键不是看跌幅本身,而是先回答一个问题:这条曲线在回落之前,是否处在一段无法持续的高位。如果高点来自一次性事件、口径变更或采集异常,那么回落才是真实水平的恢复,继续按“异常”处理反而会误导后续动作。
异常回落至少要归入三类之一,处理方式完全不同。
三者的证据链不同。回归常态需要证明“高位不可持续”,口径漂移需要证明“采集侧变了”,真实故障需要证明“站点侧变了”。把这三件事混在一起看,就会把恢复当成事故。
假设某栏目在监控里从高位回落,可以按下面的顺序取证,每一步都对应一个可证伪的判断。
一个短例子:假设某批页面在两周内因一次集中曝光而冲高,随后回到曝光前的水平。此时如果抓取覆盖、索引状态、站内点击路径都没有变化,那么把这次回落标记为“恢复”比标记为“故障”更合理。下一步动作应是更新基线,而不是启动排障。
确认回落性质之后,真正要决定的是对现有告警和基线怎么处理。
适用于回落尚未稳定、证据链不完整的情况。此时不要急着改阈值,先继续观察一个完整周期,确认曲线是否重新走平。保留的代价是可能多收几次误报,但换来的是不误删有效信号。
适用于已经确认高位不可持续、且回落终点稳定。做法是把基线锚定在回落后的区间,并同时保留对“再次跌破该区间”的告警。改写的关键是记录改写依据,否则下次同类回落会被当成新异常反复处理。
只适用于该指标本身已无法反映目标。比如某个统计口径被上游永久改变,导致历史不可比。退出前要确认替代指标能覆盖原有判断,否则会留下监控盲区。
三种选择不是并列备选,而是按证据强度递进:证据不足时保留,证据充分且稳定时改写,指标失效时才退出。
请求量、抓取量或某项统计归零,并不能单独证明处理正确。它们还有别的合理解释:采集任务中断、过滤规则误伤、上游接口限流、统计时区错位,都会产生类似的归零或骤降。同样,一次回落后指标回升,也不能证明此前的判断成立,可能只是采集恢复。
因此,任何结论都应建立在至少两条独立证据一致的基础上:采集侧与站点侧、总量与覆盖面、时间点与外部事件。只有一条证据时,正确动作是继续观察并补齐证据,而不是立即调整基线或排障顺序。
把回落先当作待分类事件而不是待修复故障,能避免在恢复期消耗排障资源;确认性质后再决定是否改写基线,才会让后续告警真正指向需要处理的变化。