直接回答:账单失控的高发区:闲置资源(停机未释放的磁盘、弹性 IP、快照堆积)、过度配置(利用率 10% 的大规格实例)、数据传输费(跨区/跨云/出公网流量常常是隐形大头)、日志与监控数据无限留存、以及被遗忘的测试环境。FinOps 治理三板斧:可见性(标签体系加成本分摊到团队)、优化(承诺折扣与现货实例、规格右调、生命周期清理)、运营(预算告警、异常检测、成本进入评审指标)。
展开解析:落地顺序建议:先打标签——没有 owner 和 environment 标签的资源无法问责,未打标资源定期扫描上报;再上自动化清理——非生产环境定时关机、磁盘随实例删除、对象存储生命周期规则把冷数据沉到归档层。计费武器用对:稳态负载买 Savings Plan/预留实例(1 年期通常省 30%+),可中断任务用 Spot(省 60%~90% 但要容忍回收);数据传输费靠架构治理——同区部署、CDN 吸收出口流量、跨区调用改异步复制。组织层面把单位成本(每订单、每千次请求的 infra 成本)做成报表,成本优化才有业务语境,而不是财务追着研发砍预算。
追问方向:为什么数据传输费常被低估?Spot 实例的回收通知如何处理?成本异常检测的基线怎么建?
(约 450 字)