直接回答:用 LLM 给模型输出打分是大规模评测的主流做法,但已知偏差不少:位置偏差(成对比较时偏好先出现或后出现的答案)、冗长偏差(偏爱更长的回答,与质量无关)、自我偏好(用 GPT 系评判时偏爱 GPT 系输出)、格式偏差(偏爱列表、加粗等“像样”排版)、权威偏差(包含引用或数字的回答更容易得高分)。

展开解析:缓解手段按有效性排序:第一,成对比较时交换两个答案的呈现顺序各评一次,取一致结论;第二,评审判据写成具体 rubric(按准确性、完整性、简洁性分项打分再汇总),而不是一句“哪个更好”;第三,控制长度变量,prompt 中明确要求忽略长度与排版;第四,用多个不同家族的 judge 投票,或加入少量人工标注校准 judge 与人类的相关系数,低于阈值就换 judge 或改 rubric;第五,事实型任务尽量用程序化校验(引用是否存在于检索内容、数值是否一致)替代主观评分。最终原则是:judge 负责规模化粗筛,抽样人工复核负责校准,任何关键结论(如“A 模型全面优于 B”)都要有人工子集背书。

追问方向:judge 模型要比被评模型强吗?如何处理 judge 无法判断的领域问题?

(约 470 字)