大模型每步输出的是词表上的概率分布,解码策略决定如何从中选词。贪心解码总选概率最高的词,确定性强但易重复乏味;采样引入随机性,三个参数控制随机程度。
Temperature 在 softmax 前把 logits 除以 T:T<1 分布变尖锐、输出更保守确定;T>1 分布变平、更随机多样;T→0 近似贪心。Top-k 只保留概率最高的 k 个候选再重新归一化采样,截断长尾。Top-p(核采样)保留累积概率达到 p 的最小候选集,候选数量随分布形状自适应——分布尖锐时只留一两个词,平坦时放宽,通常比固定 top-k 更平滑,是主流选择。
搭配实践:事实问答、代码生成用低温(0-0.3)加 top-p 0.9;创意写作用 0.8-1.2。一般不建议同时大幅调整 temperature 和 top-p,改一个即可。易错点:temperature=0 也不保证严格确定(浮点非确定性、服务端实现差异)。追问方向:为什么高温下容易重复和跑题?