深层网络反向传播时,梯度是各层雅可比矩阵的连乘。若每层增益小于 1,连乘指数级衰减,浅层几乎学不到东西,即梯度消失(Sigmoid/Tanh 饱和区会加重);若大于 1,连乘指数级增长,即梯度爆炸,表现为 loss 突变为 NaN。

缓解梯度消失:使用 ReLU/GELU 类激活(正区间梯度为 1);合理的参数初始化(Xavier/He)让各层激活方差保持稳定;归一化(BatchNorm/LayerNorm)把激活拉回合适范围;残差连接提供梯度高速公路,让梯度可以不衰减地直达浅层——这是 ResNet 能训上千层的关键。缓解梯度爆炸:梯度裁剪(设定范数阈值,大模型训练的标配)、降低学习率。

易错点:RNN 的梯度消失特指时间维度上的长程依赖丢失,LSTM 用门控加细胞状态的加法更新缓解。追问方向:为什么残差连接能缓解?LayerNorm 与 BatchNorm 在梯度传播上有何不同?