-
置顶 Atlassian 官宣将全面停售 Data Center 产品,国内用户将何去何从?
近日,Atlassian Co-CEO Mike Cannon-Brookes 在官方博客中抛出重磅消息:将在 2029 年 3 月 28 日全面停售 Data Center 产品,并正式启动名为 Atlassian Ascend 的迁移计划,帮助全球用户逐步转向 Cl…
-
高级工程经理的职责与真实处境
高级工程经理究竟负责什么?与普通工程经理相比,这一角色真正发生了哪些变化? 高效的高级工程经理,不只是推动团队完成任务,更重要的是塑造任务得以顺利完成的环境。 这一角色中最重要的工作,往往并不显眼:跨越组织边界建立信任,在缺少正式授权的情况下协调不同团队,并推动复杂决策持续向前。 真正的角色转型,不…
-
云服务性能下降事件分析:高可用架构与可用区疏散实践
10 月 22 日星期一,某海外云服务商发生了一次服务故障。由于该故障导致多个热门网站宕机数小时,事件引发了广泛关注。某海外流媒体服务提供方也受到了一定影响,但对终端用户造成的实际影响较小。 从高可用架构、故障隔离和可用区疏散的角度来看,这次事件具有较强的参考价值。回顾此次事件,我们有一些应对措施做…
-
共享事故复盘如何提升客户可靠性:SRE 与 CRE 实践经验
本文将探讨如何与受影响的客户共同回顾事故分析报告,从而获得更具可操作性的洞察,并帮助客户改进其系统架构和运维实践。对于采用 SRE 体系的团队而言,事故复盘、服务等级目标(SLO)和错误预算不仅能帮助平台方改进服务,也能帮助客户提升自身系统的可靠性。文中还将提供一个基于通用 SRE 事故分析报告模板…
-
SRE 事件管理实践:一次故障响应、回滚与事后复盘的真实案例
你有没有想过,当一家大型海外互联网公司的核心服务出现问题时,内部会如何进行 SRE 事件管理和故障响应?在技术行业里,我们常用“救火”来形容处理线上故障的过程。 当然,和真正的消防员不同,工程师面对的大多数事件通常不会直接危及生命安全。尽管这个比喻并不完全贴切,但 SRE(站点可靠性工程师)与其他领…
-
团队文化如何提升软件交付效率:为什么拥抱失败能推动高绩效
事情总会出错,这就是现实。当软件交付结果不如预期时,真正重要的不是失败本身,而是团队接下来如何应对。对于希望提升软件交付效率、DevOps 实践水平和组织绩效的团队来说,能否正确面对失败,往往决定了团队能否持续成长。 海外某些技术研究团队的研究表明,那些鼓励信任的团队文化——允许提出质疑、支持合理冒…
-
产品经理、工程经理和工程负责人如何分工?
产品研发团队通常由产品经理、工程经理组成,有时还会设置工程负责人。虽然海外某些公司会在岗位说明或工程师晋升体系中对这些角色作出定义,但在实际工作中,产品经理、工程经理和工程负责人的职责分工往往存在大量重叠,容易引发歧义和混乱。 这并不是某一家公司的特殊问题,而是许多产品研发团队都会遇到的普遍挑战。 …
-
如何管理错误预算:提升服务可靠性与 SLO 达成率的实践经验
客户可靠性工程中的错误预算管理方法 错误预算是服务可靠性管理中的重要工具,它可以帮助团队在功能发布速度与系统稳定性之间取得平衡。当服务超出服务级别目标(SLO)时,团队不应只依赖直觉决策,而应通过错误预算消耗分析,判断问题来源,并采取合适的发布控制、可靠性改进和风险缓解措施。对于研发团队而言,借助 …
-
运用 SRE 原则降低生产事故影响:CRE 实战经验与可靠性优化方法
如果你运营任何类型的互联网服务,就会知道生产事故几乎不可避免。无论架构设计多么稳健,发布流程多么严谨,最终总会有某些因素叠加失控,导致客户无法正常使用你的服务。 你努力打造用户喜爱的产品,不断推出新功能,既是为了提升现有用户的满意度,也是为了吸引更多新用户。然而,发布新功能,或者引入任何形式的变更,…
-
如何评估工程组织健康度
任何时候,工程团队的运行状态都会受到多种因素影响:业务目标变化、人员调整、技术债务、交付压力、跨团队协作,以及成员的身心状态等。 面对如此复杂的影响因素,工程领导者应该如何评估工程组织健康度,判断哪些方面运行良好,哪些方面已经出现问题?又该如何及时发现那些尚未完全暴露、却可能影响团队长期发展的风险?…