直接回答:数据污染指基准测试的题目或相似变体进入了模型的训练语料,模型实际是“背答案”而非真实能力,导致基准分数虚高、横向比较失真。常见形式:整题原样被抓进预训练语料、题目被改写后出现在指令微调数据里、测试集从公开网页泄露被爬虫收录。

展开解析:识别手段分三层。其一,n-gram 重叠检测:把测试题切 8~13 gram 与训练语料比对,命中率高即污染,GPT-3、Llama 报告都用过此法;其二,扰动测试:对题目做同义改写、换数字、换变量名后重测,分数暴跌说明靠记忆;其三,金丝雀串(canary string):新基准埋入唯一标识串(如 BIG-bench 的 26 位 GUID),要求数据清洗方按串过滤。工程上的规避:优先用发布后新建的动态基准(如 LiveBench 按月更新题目);内部评测集永不外发、不进任何公开仓库;报告分数时同时给出污染检测结果与模型训练数据截止时间。还要注意“软污染”:模型刷过大量同类题型的解题模板,泛化表现好但遇到反模式题就崩,这类只能靠分布外测试集识别。

追问方向:污染检测的 n-gram 阈值如何设定?闭源模型无法查训练语料怎么办?

(约 460 字)