直接回答:RPO(Recovery Point Objective,恢复点目标)是"最多能丢多少数据",衡量备份/复制的频率——RPO 为 5 分钟意味着故障时最多丢失最近 5 分钟的写入。RTO(Recovery Time Objective,恢复时间目标)是"多久能恢复服务",衡量从故障到业务恢复可用的时长。RTO/RPO 越小,方案越贵,两者是容灾设计的预算刻度。

常见方案与量级:定时备份恢复(每天快照)RPO 约 24 小时、RTO 数小时,成本最低;主备异步复制 + 手动切换,RPO 分钟级、RTO 几十分钟;跨可用区双活/热备 + 自动 failover,RPO 接近 0(同步复制)、RTO 秒到分钟级,但同步复制受物理距离限制(通常同城,RTT 1-2ms 内);异地多活则要用异步复制加冲突处理,RPO 难以做到零。

选型方法:先按业务分级而不是一刀切——核心交易可能要求 RPO≈0、RTO<5 分钟;内部管理系统 RPO 一天也能接受。然后把指标翻译成技术组合:RPO 由数据复制方式决定(快照、binlog 同步、存储层复制),RTO 由切换自动化程度决定(健康检查、DNS/负载均衡切换、预案演练)。特别注意:RTO 承诺必须靠真实演练验证,没演练过的预案在故障时大概率超时;备份同理,没做过恢复演练的备份不算备份。

追问方向:两地三中心架构如何取舍?数据库同步复制对写入延迟影响多大?如何设计一次容灾演练?

(约 490 字)