L1 正则把权重绝对值之和加入损失(Lasso),L2 正则把权重平方和加入损失(Ridge)。最直观的区别:L1 倾向于产生稀疏解,把不重要特征的权重压到精确为零,因此可做特征选择;L2 让权重整体均匀收缩但很少精确为零,解更稳定。
几何解释:L1 的约束区域是菱形,顶点落在坐标轴上,损失等高线容易与顶点相切从而得到零权重;L2 是圆形,没有这种偏好。从先验看,L1 对应拉普拉斯先验,L2 对应高斯先验。
易错点:L1 在零点不可导,需要用次梯度或近端梯度法;L2 在深度学习里以 weight decay 形式出现,AdamW 证明把 weight decay 从梯度更新中解耦效果更好。场景选择:高维稀疏特征、需要可解释性选 L1;一般神经网络训练选 L2/weight decay;两者结合即 Elastic Net。