CLIP

CLIP

图文配对的模型

CLIP(Contrastive Language-Image Pre-training)是 OpenAI 于 2021 年提出的多模态预训练模型,通过对比学习将图像与文字映射到同一嵌入空间,使模型无需任务专用标注即可完成零样本图像分类,并成为文生图、图文检索等多模态应用的核心基础组件。

概述

CLIP 的核心突破是以海量互联网图文配对(约 4 亿对)替代人工标注,同时训练图像编码器与文本编码器。

  • 双编码器结构:图像编码器(ResNet 或 ViT)与文本编码器(Transformer)分别产出嵌入向量,在同一空间内比较相似度。
  • 对比学习目标:同批次内配对的图文向量彼此靠近,不配对的拉远,使用 InfoNCE 损失的对称交叉熵变体。
  • 零样本推理:推理时无需微调——把候选类别写成自然语言,计算其嵌入与图像嵌入的余弦相似度,取最大值作为预测结果。
  • 规模驱动:4 亿图文对来自互联网爬取,规模是传统视觉数据集的数百倍,使模型积累了丰富的视觉-语义关联。

工作原理

预训练与推理两阶段逻辑清晰,是理解 CLIP 的核心。

  • 批次对比矩阵:一个批次内 N 张图与 N 段文本构成 N×N 余弦相似度矩阵,对角线为正例,其余为负例。
  • 对称损失:对行(图→文)和列(文→图)分别计算交叉熵后取平均,两个编码器联合优化。
  • 零样本分类流程:将所有候选标签套入模板(如「a photo of a {class}」),编码为文本向量;目标图像编码后与各文本向量做点积,最高分对应预测类别。
  • Prompt 工程影响:措辞不同(如「dog」vs「a photo of a dog」)会显著影响排序,提示词设计对零样本性能至关重要。

类型与变体

原版 CLIP 之后出现了多个重要的开源与改进版本。

  • OpenCLIP:基于公开数据集(如 LAION-5B)的开源复现,供研究者自由扩展和微调。
  • ALIGN(Google,2021):采用相似对比框架,使用规模更大、噪声更多的图文数据,验证了数据量的关键作用。
  • SigLIP(Google,2023):将损失从 softmax 对比改为逐元素 sigmoid,去掉全局负例依赖,小批量训练更稳定且效果更好。
  • Chinese-CLIP:针对中文图文对训练的适配版本,覆盖中文场景下的检索与分类任务。
  • EVA-CLIP:通过掩码图像建模与对比学习联合训练,在更大规模(18B 参数)上进一步提升性能。

应用场景

CLIP 嵌入已成为多模态 AI 工程的标准基础构件,被广泛嵌入下游系统。

  • 文生图:Stable Diffusion 使用 CLIP 文本编码器将提示词转为条件向量,引导扩散过程;DALL·E 2 以 CLIP 图像嵌入作为图像先验。
  • 图文跨模态检索:以文搜图或以图搜图直接比较两侧嵌入相似度,无需专门特征工程。
  • 零样本分类:在 ImageNet 上无需任何标注样本即可达到与监督 ResNet-50 相当的精度(约 76%)。
  • 内容审核与评估:CLIP score 作为图文一致性自动评估指标,用于衡量生成模型输出质量。
  • 视觉语言模型(VLM)视觉塔:LLaVA、InternVL 等模型以 CLIP 视觉编码器作为图像特征提取器,再接语言模型实现多模态对话。

与相邻概念的区别

理解 CLIP 的边界有助于正确选型和使用。

  • CLIP vs Stable Diffusion/DALL·E:CLIP 只做编码匹配(表示学习),不生成图像;生成模型以 CLIP 编码结果为条件输入。
  • CLIP vs BERT/GPT:CLIP 的嵌入空间跨图文模态共享,支持跨模态相似度;BERT/GPT 仅处理文本,嵌入不可与图像直接比较。
  • CLIP vs VLM(LLaVA、GPT-4V):CLIP 只编码、不生成,不具备对话或逐步推理能力;VLM 通常以 CLIP 视觉塔为基础,再接自回归语言模型实现交互。
  • CLIP vs 传统分类器(ResNet、ViT):传统模型在固定类别集上监督训练,换任务需重新微调;CLIP 通过语言描述直接泛化到新类别。

局限与误区

CLIP 的零样本能力并非万能,存在明确的适用边界。

  • 细粒度任务弱:同科鸟类亚种、病理影像病灶等细粒度识别任务,CLIP 零样本性能明显弱于领域微调模型。
  • 空间与计数推理差:对「左边」「三个」等空间关系或数量描述的理解较弱,本质上是大规模共现统计而非真正推理。
  • 数据偏见:训练数据来自互联网,嵌入向量会编码性别、种族、职业等社会偏见与有害关联。
  • Prompt 敏感:「cat」与「a photo of a cat」可能产生不同排序,提示词工程对最终性能影响显著。
  • 常见误区:把「图文对齐」等同于「理解图像内容」——CLIP 的匹配是统计共现的产物,不具备因果理解或视觉推理能力。

发展脉络

对比学习与多模态预训练的融合经历了数年演进。

  • 2020:自监督对比学习(SimCLR、MoCo v2)在纯视觉领域验证了大规模无标注预训练的可行性。
  • 2021:OpenAI 发布 CLIP,Google 发布 ALIGN,图文对比学习正式成为多模态预训练主流范式。
  • 2021:DALL·E 2 和 Stable Diffusion 等文生图模型将 CLIP 嵌入作为生成条件,CLIP 进入工程落地阶段。
  • 2022:LAION 发布 LAION-5B 数据集,OpenCLIP 基于其实现开源复现,推动学术界大规模研究。
  • 2023:SigLIP(Google)改进损失函数,EVA-CLIP 扩展参数规模至 18B,性能持续提升。
  • 2023 至今:CLIP 视觉编码器成为多模态大语言模型(LLaVA、InternVL、Qwen-VL 等)的标准视觉塔组件。

常见误解

日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。

  • 「图文配对的模型」
  • 「多模态热点」
  • 「跟 CLIP 是一回事吗」

相关术语

和本术语关联紧密的其他词条,便于串联理解。

🎯 考点练习

含该术语的高频面试题,含标准答案与追问。

延伸阅读

从知识库精选 2 篇文章,帮助深入理解该术语。

  1. 1

    多模态学习(一):CLIP 视觉-语言预训练

    从对比学习到零样本分类,理解 CLIP 如何连接视觉与语言

  2. 2

    卷积操作详解(实战):卷积核、步长、填充

    深入理解卷积运算的每一个细节,掌握 CNN 的基石

外部参考

维基百科:查看「CLIP」词条

本页内容为本站原创撰写;维基百科链接仅作延伸参考。