事后复盘
-
云服务性能下降事件分析:高可用架构与可用区疏散实践
10 月 22 日星期一,某海外云服务商发生了一次服务故障。由于该故障导致多个热门网站宕机数小时,事件引发了广泛关注。某海外流媒体服务提供方也受到了一定影响,但对终端用户造成的实际影响较小。 从高可用架构、故障隔离和可用区疏散的角度来看,这次事件具有较强的参考价值。回顾此次事件,我们有一些应对措施做…
-
共享事故复盘如何提升客户可靠性:SRE 与 CRE 实践经验
本文将探讨如何与受影响的客户共同回顾事故分析报告,从而获得更具可操作性的洞察,并帮助客户改进其系统架构和运维实践。对于采用 SRE 体系的团队而言,事故复盘、服务等级目标(SLO)和错误预算不仅能帮助平台方改进服务,也能帮助客户提升自身系统的可靠性。文中还将提供一个基于通用 SRE 事故分析报告模板…
-
SRE 事件管理实践:一次故障响应、回滚与事后复盘的真实案例
你有没有想过,当一家大型海外互联网公司的核心服务出现问题时,内部会如何进行 SRE 事件管理和故障响应?在技术行业里,我们常用“救火”来形容处理线上故障的过程。 当然,和真正的消防员不同,工程师面对的大多数事件通常不会直接危及生命安全。尽管这个比喻并不完全贴切,但 SRE(站点可靠性工程师)与其他领…
-
事后复盘文化:SRE 如何通过无责复盘从失败中学习
作为 SRE(站点可靠性工程师),我们维护的是大规模、复杂的分布式系统。我们不断为服务添加新功能,引入新系统。鉴于系统规模庞大、变化速度极快,故障和中断不可避免。当故障发生时,我们会修复根本问题,使服务恢复正常运行。然而,如果没有一套正式的事后复盘流程来从故障中吸取经验教训,同样的问题就可能反复出现…