多模态(Multimodal)
多模态又能看图又能说话
亦作、亦称:Multimodal
多模态模型能够同时处理和生成文本、图像、音频、视频等多种类型数据,是当前大模型走向通用智能的重要方向。与单模态模型相比,多模态模型通过跨模态表征对齐,使机器能够融合多感官信息进行理解与创造。
概述
多模态 AI 的核心目标是让模型像人类一样同时感知和表达多种信息形式。
- 模态(Modality):信息的类型或形式,常见模态包括文本、图像、音频、视频、传感器数据等
- 跨模态理解:模型不仅能处理单一模态,还能理解不同模态之间的语义关联,例如「看图说话」或「根据描述生成图片」
- 统一表征:多模态模型的关键挑战是将来自不同模态的信息映射到同一向量空间,使其可互相比较和组合
- 输入 vs. 输出:部分模型只支持多模态输入(如读图回答问题),另一些还支持多模态输出(如生成图像或语音)
- 代表模型:GPT-4V、Gemini 1.5、Claude 3、LLaVA、CogVLM 等均属多模态大模型
工作原理
多模态模型通常由专用编码器、跨模态对齐模块和统一语言模型三部分组成。
- 模态专用编码器:图像通过 ViT(Vision Transformer) 或 CNN 编码为向量序列,音频通过 Whisper 等模型转为特征向量,文本通过词嵌入处理
- 跨模态对齐:将各模态向量投影到共享语义空间,CLIP 是最具代表性的对比学习对齐方法——用海量图文对训练,使相符的图文向量互相靠近
- 多模态融合:对齐后的各模态 token 与文本 token 拼接送入 Transformer 主干,注意力机制自然地跨模态建立关联
- 指令微调:通过 SFT(监督微调) 和 RLHF 让模型学会遵循「分析这张图片」「用中文描述」等复合指令
- 投影层(Projector):LLaVA 等方案用一个轻量 MLP 将视觉 token 映射到语言模型的词向量空间,是低成本实现多模态的常见做法
类型与变体
按模态组合和能力边界,多模态模型可分为以下几类。
- 视觉-语言模型(VLM):最主流类型,处理图像+文本,代表作有 GPT-4V、LLaVA、InternVL
- 图像生成模型:以文本为输入生成图像,如 Stable Diffusion、DALL-E 3,属于文本→图像的单向多模态
- 音频-语言模型:结合语音理解与文本生成,Whisper 做语音识别,GPT-4o 实现端到端语音对话
- 视频理解模型:处理连续帧序列,Gemini 1.5 Pro 可接受长达数小时的视频输入
- 具身多模态(VLA):视觉-语言-动作模型,将感知与机器人控制结合,代表作有 OpenVLA
- 任意模态(Any-to-Any):目标是输入输出均可为任意模态,GPT-4o 和 Gemini 是当前最接近此目标的商业模型
应用场景
多模态能力显著扩展了 AI 的可用边界,落地场景覆盖生产和生活多个领域。
- 图文问答(VQA):上传产品图片询问规格、拍照搜题、看医学影像辅助诊断
- 文档理解:解析 PDF 表格、合同截图、发票图片,提取结构化信息
- 内容创作:根据文字描述生成配图、为视频自动生成字幕或配音
- 代码与 UI:截图转代码(如 GPT-4V 将设计稿生成 HTML),视觉调试界面 bug
- 无障碍辅助:为视障人士描述图片内容、实时语音转文字
- 工业质检:结合视觉和文本规范,自动判定产品缺陷
与相邻概念的区别
多模态容易与几个相关概念混淆,以下逐一厘清。
- 多模态 vs. 纯语言模型(LLM):LLM 仅处理文本序列;多模态模型在 LLM 基础上引入额外编码器和对齐模块,能理解非文本输入
- 多模态 vs. CLIP:CLIP 是一种跨模态表征对齐方法,是构建多模态模型的工具/组件,而多模态模型是完整可交互的系统
- 多模态 vs. 跨模态检索:跨模态检索(如以文搜图)只做相似度匹配,不生成内容;多模态模型还具备理解、推理和生成能力
- 多模态 vs. 融合(Fusion):Fusion 是多模态模型内部的技术实现手段(早期融合、晚期融合等),不是模型类型本身
- 多模态 vs. 多智能体(Multi-Agent):Multi-Agent 指多个 AI 协作,与模态数量无关;两者可结合但概念正交
局限与误区
多模态模型虽然强大,但现阶段仍存在若干明显短板。
- 跨模态幻觉:模型可能「看」到图中并不存在的物体或文字,比纯文本幻觉更难被用户察觉
- 细粒度视觉理解不足:识别密集文字、复杂数学公式或低分辨率图像时准确率仍有明显差距
- 训练数据偏差:图文训练对多为英文和西方场景,中文文档、非拉丁文字的识别效果普遍偏弱
- 高计算成本:多模态模型的 KV Cache 和推理内存需求远高于同规模纯语言模型
- 误区——「多模态 = 更智能」:多模态扩展了感知通道,但并不自动提升推理深度;模型仍可能在视觉问题上犯低级逻辑错误
发展脉络
多模态 AI 从早期的专用系统逐步演进为通用大模型的标配能力。
- 2014:Show and Tell 论文提出 CNN+RNN 的看图说话框架,奠定早期视觉-语言基础
- 2019:ViLBERT 等模型将 BERT 预训练范式引入视觉-语言联合建模
- 2021:OpenAI 发布 CLIP 和 DALL-E,前者确立对比学习对齐范式,后者展示文本生成图像的商业潜力
- 2022:Google 发布 Flamingo,首次展示大规模视觉-语言少样本学习;Stable Diffusion 开源,图像生成民主化
- 2023:OpenAI 推出 GPT-4V,多模态能力首次进入主流商用 LLM;LLaVA 等开源方案涌现
- 2024:GPT-4o 实现文本/图像/语音端到端统一,Gemini 1.5 Pro 支持超长视频上下文,多模态进入「原生」时代
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「又能看图又能说话」
- 「多模态热点」
- 「跟 多模态 是一回事吗」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
- 中级场景查看详解 →
如何用 AI 做票据 / 证件的 OCR 信息提取?
OCR 或多模态大模型读图拿文本,再用 LLM 按 schema 抽字段并校验,模糊手写需置信度和人工复核。
- 中级概念高频查看详解 →
CLIP 如何对齐图像与文本表示?
图像、文本双编码器各出嵌入,用对比学习(InfoNCE)拉近匹配对、推远不匹配对,在共享空间实现跨模态对齐。
- 中级概念查看详解 →
语音识别(ASR)的主流方法有哪些(CTC / Whisper)?
CTC 逐帧预测并用 blank 实现对齐无关解码;Whisper 是 seq2seq Transformer,靠大规模弱监督数据训练。
- 中级概念查看详解 →
音频特征:梅尔频谱与 MFCC 是什么?
梅尔频谱是按梅尔刻度排布的频谱图;MFCC 是对数梅尔谱再做 DCT 取低阶系数得到的紧凑特征。
延伸阅读
从知识库精选 2 篇文章,帮助深入理解该术语。
外部参考
维基百科:查看「多模态」词条本页内容为本站原创撰写;维基百科链接仅作延伸参考。
