确定异常开始时间,不能只看统计报表里数值最低的那一天,而要先明确“异常”的定义,再用同一口径的数据向前回溯,找到指标第一次持续偏离正常范围的时间点。对网站数据统计来说,这个时间点往往比最低点更早,也更接近真正的原因发生时刻。
很多人看到流量或转化跌到谷底,就把那一天记为异常开始时间。这通常不准确。原因有两层:一是数据从发生到被统计、被展示,中间可能经过采集延迟和处理延迟;二是异常本身有一个发展过程,比如页面模板出错后,曝光先减少,点击再减少,最终才体现在会话数上。最低点只是结果最明显的时刻,不等于原因首次出现的时刻。
还有一种情况是把“发现时间”当成“开始时间”。值班人员今天上午看到报警,不代表异常今天上午才发生。如果没有记录,回溯时必须以数据本身的变化为依据,而不是以人的记忆为依据。
异常开始时间依赖于判断标准。不同标准会得出不同答案,所以要先写清楚用的是哪一种:
标准不同,起始点可能相差数小时甚至数天。因此诊断记录里应同时写明指标名称、比较基线、时间粒度和判定规则,否则不同人复核会得出不同结论。
可靠的做法是建立一条从现象到原因的证据链。可以按下面的顺序执行:
例如,假设某站自然搜索会话从某天下午开始下降。按天看,下降出现在周二;按小时看,实际从周一下午四点后开始。进一步核对发现,周一四点左右有一次页面模板发布。此时可以判断异常开始时间在发布之后、指标首次持续偏离之前,而不是周二。这个例子只说明方法,具体时间需要以实际数据为准。
回溯得到的时间点未必唯一。以下情况需要分别处理:
如果只能确认“可能原因”而无法定位,应把结论写成待验证假设,并列出下一步需要采集的证据,而不是把推测当成已确认的事实。
下一次遇到指标异常时,按这份清单操作:先固定指标口径和基线,再缩小时间粒度,然后标记第一个持续偏离点,最后对照变更记录和独立数据源。判断标准是:如果换一个人用同样的口径和粒度复核,能得到相同或接近的时间点,这个结论才足够可靠。若无法复现,说明定义或数据还不够清晰,需要补充证据后再下结论。
下一步建议是:为常用指标预先写好异常判定规则和基线范围,并在每次发布或配置变更时留下时间记录。这样异常发生时,回溯会从猜测变成核对。