CLIP 用「图文对」做对比学习,把图像和文本映射到同一向量空间,从而实现零样本分类。它是现代多模态(VLM、扩散、图文检索)的共同地基。本文讲清双塔、对比损失与零样本机制。
CLIP(Contrastive Language–Image Pre-training)用海量「图片+文字」配对做对比学习:让「配对的图文」向量相近、「不配对」的相远。结果图像和文本被塞进同一个向量空间——于是用文字就能检索图、图也能零样本分类。它是多模态时代的地基。
传统视觉模型在固定标签集(如 ImageNet 1000 类)上训,换任务就重训。CLIP 改用自然语言监督:互联网上现成的「图+描述」对就是免费标注,监督信号丰富得多,且天然支持开放词汇。
两个独立编码器,分别把图像和文本编码成同维向量:
一个 batch 内有 N 个图文对。对每对 (i,i),正样本是它自己,其余 N−1 个图文组合是负样本。目标:对角线上的相似度最高。
推理时不需任何训练样本:把候选类别名写成 prompt(如 "a photo of a {class}"),与图像编码算余弦相似度,取最相似的类别。