直接回答:最小闭环:分桶(用用户 ID 的稳定哈希把流量切成互斥桶,同用户始终同组)、分流(配置中心下发实验与桶的映射,端上按映射渲染对应版本)、埋点(曝光事件必须带实验 ID 与组别名,转化事件与之关联)、分析(按分组聚合指标,做显著性检验,达到预设样本量与时长再下结论)。

展开解析:分桶的坑:用请求随机数分桶会导致同一用户每次进不同组(体验割裂且指标无法归因);多实验并行要分层(每层独立哈希空间),否则实验间互相污染。埋点的坑:只埋点击不埋曝光导致分母缺失;SPA 里路由切换不触发页面曝光要手动补;曝光打点要在组件真实可见时(IntersectionObserver)而非渲染时,否则“没看到也算看过”稀释效果。分析的坑最多:没跑满预设周期就偷看结果(peeking problem,假阳性飙升,要么预设停止规则要么用序贯检验);新奇效应——老用户对新设计短期抵触,前三天数据不代表稳态;指标选取要有护栏指标(加载时长、错误率),防止“转化率涨了但白屏率也涨了”;样本量预估事先算(基线转化率、最小可检测效应、功效 80%),效应越小吃样本越凶。工程上建议实验平台统一分桶与埋点 SDK,业务方只声明实验变量,把统计纪律沉淀进平台而非依赖每个人自觉。

追问方向:灰度发布与 AB 实验的关系与区别?如何评估实验平台的埋点质量?

(约 490 字)