类别不平衡下模型会偏向多数类,常用手段分三层:数据层、算法层、评估层。数据层:对少数类过采样(随机复制或 SMOTE 插值生成合成样本)、对多数类欠采样、两者结合。算法层:类别加权损失(按频率倒数加权)、Focal Loss(降低易分类样本权重,聚焦难例)、调整决策阈值。评估层:弃用准确率,改用 F1、PR-AUC、混淆矩阵。
易错点:SMOTE 在高维稀疏数据(如文本)上可能产生无意义样本;过采样必须在训练折内部做,否则验证集泄漏导致指标虚高;欠采样可能丢掉多数类的重要信息。
追问方向:极端不平衡(如万分之一的欺诈交易)为什么常用异常检测或 PU learning 框架而非普通分类?阈值移动与代价敏感学习的等价关系是什么?实践建议:先加权重和调阈值,成本最低收益往往最大。