谁:运维工程师和值班负责人听到业务方上线要求“别崩”“别卡”,但没有延迟、可用性或错误预算指标。 何事:缺少SLO使告警阈值、容量扩容和发布回滚都失去判断依据,线上抖动只能靠人工感觉。 何时:在应用接入生产环境前72小时,运维要求业务方提供用户可容忍的最大不可用时长。 何地:在云原生可观测平台和On-call值班看板中,运维、业务与开发共同确定指标口径和时间窗口。 如何:用SLO方法把“别崩”转为“30天可用性不低于99.9%,P95延迟低于400毫秒,错误率低于0.5%”,并设置错误预算消耗超过50%时自动禁止发布,同时让AI告警降噪工具聚合误报。
相似问题