Decoder-only 架构把整段输入视为一个连续序列,用因果掩码(上三角置 −∞)保证每个位置只能看到自己和之前的内容,训练目标是标准的下一个 token 预测。GPT 系列成功后,LLaMA、Qwen、DeepSeek 等几乎全部主流 LLM 沿用此架构。
胜出的原因:一是训练目标极其统一,任意文本都能构造自监督样本,可充分利用海量语料;二是架构简单、工程友好,同一模型无缝兼顾理解与生成,无需 encoder-decoder 的复杂对齐;三是 Zero-shot 泛化好,研究表明 decoder-only 在无任务适配时表现最强;四是 KV cache 推理高效。相比之下,BERT 式 encoder-only 只出不进(不能直接生成),T5 式 encoder-decoder 训练数据利用率低。
易错点:因果掩码只作用于注意力权重,不改变网络结构;前缀 LM(输入部分双向、输出部分因果)是中间路线。追问方向:为什么下一个 token 预测这么简单就能涌现出推理能力?