直接回答:RTO(恢复时间目标)是故障后多久恢复服务,RPO(恢复点目标)是能容忍丢多少数据。容灾等级按两者逐级收紧:备份恢复(RTO 小时级、RPO 取决于备份频率,最省钱);Pilot Light(异地只保留核心最小集如数据库复制,故障时拉起,RTO 十分钟级);Warm Standby(异地跑缩容版全栈,切换时扩容,RTO 分钟级);多活(双中心同时服务,RTO/RPO 趋近零,成本与复杂度最高)。选型由业务损失曲线决定,不是越高越好。

展开解析:多 AZ 与多 region 要分清:同 region 多 AZ 用同步复制(延迟低)扛机房级故障,RPO 近零是标配;跨 region 普遍异步复制,RPO 是秒到分钟级,扛区域级灾难。架构关键点:数据层复制是地基(数据库跨区副本、对象存储跨区域复制);状态外移(会话进外部存储)让应用层可随意重建;DNS/全局负载做流量切换,TTL 决定切换下限。最大的坑是从不演练:备份能否恢复、切换脚本是否可用、容量是否够承载全量流量,只有定期灾备演练(含强制故障注入)能回答。合规行业(金融)对演练频率和 RTO/RPO 有硬性审计要求。

追问方向:多活架构的写冲突怎么处理?为什么切换要防脑裂?混沌工程演练的爆炸半径如何控制?

(约 460 字)