学习率是训练最重要的超参数:过大震荡发散,过小收敛缓慢且易困于差的局部区域。学习率调度让训练过程动态调整步长——前期大步探索,后期小步精调,兼顾速度与收敛精度。
常见策略:阶梯衰减(每 N 个 epoch 乘以 0.1,简单常用);余弦退火(按余弦曲线平滑降到接近零,现代训练的主流);线性/多项式衰减;warmup(训练初期从小学习率线性升到目标值)。warmup 对 Transformer 尤其关键:Adam 的二阶矩估计在初始几步偏差大,直接上大学习率会更新过猛破坏预训练权重,大模型训练普遍采用 warmup + 余弦衰减组合。
易错点:调度周期应与总训练步数匹配,余弦退火的周期设错会导致末期学习率不合预期;微调大模型时学习率通常比预训练小一个数量级(如 1e-5 量级)。追问方向:Warm Restarts(SGDR)的思想?学习率与 batch size 的线性缩放规则?