幻觉指模型生成看似合理但与事实不符或无中生有的内容,分两类:事实性幻觉(违背客观事实)和忠实性幻觉(偏离给定上下文或指令)。
成因:训练目标是下一个词预测,本质是概率续写而非事实检索,模型对'不知道的'同样输出高置信文本;训练语料含错误信息且存在长尾知识覆盖不足;SFT 阶段标注者演示了'不懂也敢答'的风格会放大问题;自回归生成中错误会逐步累积。
缓解手段:RAG 检索权威资料注入上下文,让回答有据可依,是当前最有效的工程手段;提示工程要求模型引用来源、不确定时明确说明;解码端降低 temperature 减少随机性;训练端用 RLHF/DPO 奖励'拒答未知'、提升事实一致性;产品端加来源引用与人工审核。需要清醒认识:幻觉无法彻底消除,只能降低频率并通过架构(检索、工具、校验)兜底。追问方向:如何评估幻觉率(FactScore、RAGAS 忠实度)?为什么闭卷问答比开卷更容易幻觉?