直接回答:没有任何单一指标能衡量 LLM,需要分层组合。预训练阶段看 perplexity 和下游 few-shot 基准;对齐之后看能力基准:知识类(MMLU、GPQA)、数学推理(GSM8K、MATH)、代码(HumanEval、SWE-bench)、指令遵循(IFEval)、长文本(RULER 等)。开放式生成质量与人类偏好靠人工评测或 LLM-as-judge,规模化的偏好对比则用 Chatbot Arena 这类众包对战平台算 Elo 排名。

展开解析:主要陷阱有三类。一是数据污染:基准测试集泄漏进训练语料会使分数严重虚高,应对方法是 n-gram 重叠检测、使用持续更新的动态基准(如 LiveBench)或私有评测集。二是 LLM-as-judge 的系统性偏差:位置偏置(偏好排在前面的答案)、冗长偏置(无原则偏爱长回答)、自偏好(偏向同源模型的输出风格),缓解手段包括交换顺序双评取一致、提供明确的评分量表(rubric)、定期与人工标注抽样对齐相关系数。三是基准分数与业务体验之间的鸿沟:MMLU 高不代表你的客服场景好用,生产上必须自建领域金标集做版本间的持续回归评测,配合线上 A/B 实验和用户反馈闭环,并把成本、首 token 延迟、拒答率一并纳入评估看板,避免单一维度优化。

追问方向:如何检测一个模型是否被基准污染?Elo 评分的前提假设与失效场景是什么?如何为一个垂直业务设计有区分度的评测集?(约 530 字)