上下文长度受两个层面限制:位置编码的外推能力与训练成本。RoPE 训练时只见过 L 以内的旋转角,推理超出后注意力分布紊乱,直接外推会崩坏。主流扩展手段:位置插值(PI)把位置索引按比例压缩进训练范围,需少量微调;NTK-aware 插值按维度差异化缩放,高频维度少插、低频多插,保局部细节;YaRN 进一步引入注意力温度修正,用极少微调即可数倍扩展,Qwen 等模型采用。
训练侧:长序列训练成本随长度平方增长,需要环形注意力(Ring Attention)跨设备切分序列、FlashAttention 降低显存,并用长短数据混合的持续预训练让模型真正学会利用远处信息。推理侧则靠 KV cache 量化、稀疏注意力控制成本。
易错点:窗口标称长度不等于有效长度,'大海捞针'测试能插在中间不代表模型能深度推理长文档,常见中间遗忘(lost in the middle)。追问方向:RAG 与长上下文是替代还是互补关系?(答案:互补——成本、时延、有效利用率的权衡)