直接回答:上下文学习指模型仅根据提示词中给出的几个输入输出示例(demonstrations)就学会完成一个新任务,全程不发生任何参数更新——"学习"发生在前向传播的激活值里,推理结束即遗忘。它是模型规模带来的涌现能力:模型越大、预训练数据越多样,ICL 表现越强,这也是 GPT-3 当年震动业界的核心卖点。
展开解析:有效性有几种互补的解释。机制层面,研究者在大模型中定位出"归纳头"(induction heads)——专门实现"前文出现过 A 后面跟 B,那么再见到 A 就预测 B"这类模式复制的注意力回路,被认为是 ICL 的基本构件;贝叶斯视角认为 ICL 本质是在隐式推断提示背后的潜在任务概念;还有理论工作证明线性注意力层可以在前向计算中隐式执行类似梯度下降的更新。实践要点:示例的质量和相关性远比数量重要;标签分布失衡与示例顺序都会显著改变结果(模型有 recency bias,倾向模仿最后一个示例);分类任务可对输出标签做校准消除先验偏差。局限在于:性能对示例选择敏感、方差大;示例占用上下文且每次推理都要重复计算,成本高;任务分布与预训练差异过大时 ICL 直接失效。任务固定、调用量大时,微调通常比长提示更稳、更省。
追问方向:归纳头是如何被发现和验证的?有研究表明示例标签随机打乱 ICL 仍部分有效,这说明什么?ICL 与微调之间的选型边界在哪里?(约 540 字)