直接回答:LIMA 等工作验证过:几百到几千条精选数据就能激发基座模型的指令跟随能力,而低质量数据(格式混乱、答案错误、风格不一)会直接污染行为。质量体现在三处:答案正确性(事实错误会被忠实学会)、格式一致性(输出结构不统一模型就学不到结构)、覆盖多样性(任务类型、长度、语言分布决定泛化面)。
展开解析:构造流程:先定数据规格——任务分类体系(问答、改写、代码、推理各占多少)、格式模板、长度分布目标;再定来源优先级:专家撰写 > 强模型生成加人工审核(Self-Instruct 路线)> 真实用户数据脱敏改写 > 纯模型生成不审核(基本不可用)。清洗环节:去重(含近重复,用 MinHash)、去低质(过短过水、拒答模板过多)、去污染(与评测集做 n-gram 比对)。配比上宁缺毋滥:一万条混杂数据常不如一千条精数据,多余预算应花在多样性上而非堆同类型。验证手段:小规模消融——固定其他变量只换数据集训两版,跑同一评测集对比,数据质量差异会清晰反映在尾部 badcase 率上。还要注意分布匹配:微调数据的语言、领域、难度分布应尽量贴近线上请求分布,否则模型在真实流量上表现打折。
追问方向:合成数据如何避免模型坍缩?拒答样本比例多少合适?
(约 460 字)