直接回答:SFT 数据构造的公式是“多样任务 × 高质量答案 × 严格清洗”。来源可以是人工编写、强模型蒸馏(用更强的模型生成答案再人工抽检)、真实业务数据脱敏改造。经验结论(LIMA 等研究反复验证):几千条精心打磨的样本就能显著改变模型行为,而十万条噪声数据反而教会模型敷衍与幻觉——模型学到的是答案的风格与习惯,坏样本教出坏习惯。

展开解析:质量标准拆解:指令覆盖度要够(目标场景的任务类型、长度、语言分布都应有);答案要符合期望的格式与口吻,想让模型“不知道就说不知道”,数据里就必须有拒答样本;多轮对话数据要注意历史轮次的合理性。清洗流水线:去重(含近似重复,防止过拟合到特定样本)、去模板化(大量“作为 AI 助手”开头的答案会让模型变啰嗦)、长度过滤、用奖励模型或规则粗筛低质答案再人工抽检。蒸馏数据的版权与协议风险要确认(部分模型协议禁止用其输出训练竞品)。最后用消融实验验证:留一份验证集,对比加入某批数据前后的效果,数据建设要像代码一样可回溯、可评审。

追问方向:蒸馏数据与人工数据如何配比?如何检测训练数据被污染进评测集?

(约 460 字)