直接回答:CLIP 采用双塔结构:图像编码器(ViT)和文本编码器(Transformer)分别把图片与文本映射到同一维度的向量空间,训练目标是 batch 内 N 对图文的对比损失(InfoNCE)——让配对的图文向量相似度最大,与其余 N-1 个负样本的相似度全部压低。OpenAI 用 4 亿对网络图文训练后,两个模态的语义在同一空间中对齐,于是可以零样本图像分类:把类别名填进提示词模板编码成文本向量,与图像向量算余弦相似度取最大者即可,全程不需要任何下游微调。

展开解析:生成式多模态大模型(VLM)沿用"先对齐"的思路但换了接法:冻结的视觉编码器(常直接复用 CLIP ViT)提取图像 patch 特征,经一个轻量投影器(LLaVA 用 MLP,BLIP-2 用 Q-Former,Flamingo 用交叉注意力)映射成与词嵌入同维的"视觉 token",直接拼进 LLM 的输入序列。训练通常分两阶段:先冻结 LLM 只做模态对齐预训练,再部分解冻做视觉指令微调。工程难点在于高分辨率切分导致视觉 token 数量膨胀、挤压文本上下文,以及视觉细节幻觉——模型会"脑补"图中不存在的文字与物体,需要专门的评测与数据手段缓解。

追问方向:InfoNCE 中温度系数起什么作用?Q-Former 与 MLP 投影器各自的取舍?为什么 VLM 容易出现物体幻觉,有哪些针对性评测集?(约 540 字)