CLIP
CLIP图文配对的模型
CLIP(Contrastive Language-Image Pre-training)是 OpenAI 于 2021 年提出的多模态预训练模型,通过对比学习将图像与文字映射到同一嵌入空间,使模型无需任务专用标注即可完成零样本图像分类,并成为文生图、图文检索等多模态应用的核心基础组件。
概述
CLIP 的核心突破是以海量互联网图文配对(约 4 亿对)替代人工标注,同时训练图像编码器与文本编码器。
- 双编码器结构:图像编码器(ResNet 或 ViT)与文本编码器(Transformer)分别产出嵌入向量,在同一空间内比较相似度。
- 对比学习目标:同批次内配对的图文向量彼此靠近,不配对的拉远,使用 InfoNCE 损失的对称交叉熵变体。
- 零样本推理:推理时无需微调——把候选类别写成自然语言,计算其嵌入与图像嵌入的余弦相似度,取最大值作为预测结果。
- 规模驱动:4 亿图文对来自互联网爬取,规模是传统视觉数据集的数百倍,使模型积累了丰富的视觉-语义关联。
工作原理
预训练与推理两阶段逻辑清晰,是理解 CLIP 的核心。
- 批次对比矩阵:一个批次内 N 张图与 N 段文本构成 N×N 余弦相似度矩阵,对角线为正例,其余为负例。
- 对称损失:对行(图→文)和列(文→图)分别计算交叉熵后取平均,两个编码器联合优化。
- 零样本分类流程:将所有候选标签套入模板(如「a photo of a {class}」),编码为文本向量;目标图像编码后与各文本向量做点积,最高分对应预测类别。
- Prompt 工程影响:措辞不同(如「dog」vs「a photo of a dog」)会显著影响排序,提示词设计对零样本性能至关重要。
类型与变体
原版 CLIP 之后出现了多个重要的开源与改进版本。
- OpenCLIP:基于公开数据集(如 LAION-5B)的开源复现,供研究者自由扩展和微调。
- ALIGN(Google,2021):采用相似对比框架,使用规模更大、噪声更多的图文数据,验证了数据量的关键作用。
- SigLIP(Google,2023):将损失从 softmax 对比改为逐元素 sigmoid,去掉全局负例依赖,小批量训练更稳定且效果更好。
- Chinese-CLIP:针对中文图文对训练的适配版本,覆盖中文场景下的检索与分类任务。
- EVA-CLIP:通过掩码图像建模与对比学习联合训练,在更大规模(18B 参数)上进一步提升性能。
应用场景
CLIP 嵌入已成为多模态 AI 工程的标准基础构件,被广泛嵌入下游系统。
- 文生图:Stable Diffusion 使用 CLIP 文本编码器将提示词转为条件向量,引导扩散过程;DALL·E 2 以 CLIP 图像嵌入作为图像先验。
- 图文跨模态检索:以文搜图或以图搜图直接比较两侧嵌入相似度,无需专门特征工程。
- 零样本分类:在 ImageNet 上无需任何标注样本即可达到与监督 ResNet-50 相当的精度(约 76%)。
- 内容审核与评估:CLIP score 作为图文一致性自动评估指标,用于衡量生成模型输出质量。
- 视觉语言模型(VLM)视觉塔:LLaVA、InternVL 等模型以 CLIP 视觉编码器作为图像特征提取器,再接语言模型实现多模态对话。
与相邻概念的区别
理解 CLIP 的边界有助于正确选型和使用。
- CLIP vs Stable Diffusion/DALL·E:CLIP 只做编码匹配(表示学习),不生成图像;生成模型以 CLIP 编码结果为条件输入。
- CLIP vs BERT/GPT:CLIP 的嵌入空间跨图文模态共享,支持跨模态相似度;BERT/GPT 仅处理文本,嵌入不可与图像直接比较。
- CLIP vs VLM(LLaVA、GPT-4V):CLIP 只编码、不生成,不具备对话或逐步推理能力;VLM 通常以 CLIP 视觉塔为基础,再接自回归语言模型实现交互。
- CLIP vs 传统分类器(ResNet、ViT):传统模型在固定类别集上监督训练,换任务需重新微调;CLIP 通过语言描述直接泛化到新类别。
局限与误区
CLIP 的零样本能力并非万能,存在明确的适用边界。
- 细粒度任务弱:同科鸟类亚种、病理影像病灶等细粒度识别任务,CLIP 零样本性能明显弱于领域微调模型。
- 空间与计数推理差:对「左边」「三个」等空间关系或数量描述的理解较弱,本质上是大规模共现统计而非真正推理。
- 数据偏见:训练数据来自互联网,嵌入向量会编码性别、种族、职业等社会偏见与有害关联。
- Prompt 敏感:「cat」与「a photo of a cat」可能产生不同排序,提示词工程对最终性能影响显著。
- 常见误区:把「图文对齐」等同于「理解图像内容」——CLIP 的匹配是统计共现的产物,不具备因果理解或视觉推理能力。
发展脉络
对比学习与多模态预训练的融合经历了数年演进。
- 2020:自监督对比学习(SimCLR、MoCo v2)在纯视觉领域验证了大规模无标注预训练的可行性。
- 2021:OpenAI 发布 CLIP,Google 发布 ALIGN,图文对比学习正式成为多模态预训练主流范式。
- 2021:DALL·E 2 和 Stable Diffusion 等文生图模型将 CLIP 嵌入作为生成条件,CLIP 进入工程落地阶段。
- 2022:LAION 发布 LAION-5B 数据集,OpenCLIP 基于其实现开源复现,推动学术界大规模研究。
- 2023:SigLIP(Google)改进损失函数,EVA-CLIP 扩展参数规模至 18B,性能持续提升。
- 2023 至今:CLIP 视觉编码器成为多模态大语言模型(LLaVA、InternVL、Qwen-VL 等)的标准视觉塔组件。
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「图文配对的模型」
- 「多模态热点」
- 「跟 CLIP 是一回事吗」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
- 中级概念高频查看详解 →
CLIP 如何对齐图像与文本表示?
图像、文本双编码器各出嵌入,用对比学习(InfoNCE)拉近匹配对、推远不匹配对,在共享空间实现跨模态对齐。
- 高级系统设计查看详解 →
如何设计一个以图搜图 / 多模态搜索系统?
CLIP 统一图文 embedding + 向量库 ANN 召回 + rerank + 属性过滤的混合检索,优化 Recall@K 与延迟。
- 中级概念查看详解 →
BLIP 等图文预训练模型是如何工作的?
BLIP 用图文对比、图文匹配、图生文三任务联合预训练;BLIP-2 用 Q-Former 桥接冻结的图像编码器与 LLM。
- 中级概念查看详解 →
对比学习(Contrastive Learning)的核心思想是什么?
在嵌入空间拉近正样本对、推远负样本对,靠 InfoNCE 损失学到判别性表示,无需类别标签即可自监督预训练。
延伸阅读
从知识库精选 2 篇文章,帮助深入理解该术语。
外部参考
维基百科:查看「CLIP」词条本页内容为本站原创撰写;维基百科链接仅作延伸参考。
