VQA(视觉问答)
VQA看图回答问题
亦作、亦称:视觉问答 · Visual Question Answering
视觉问答(VQA)是一项要求模型同时理解图像内容与自然语言问题、并给出自由文本答案的多模态任务。它是衡量模型「看懂图 + 读懂问 + 跨模态推理」综合能力的经典基准。
概述
VQA 将计算机视觉与自然语言处理融合为单一任务,要求模型完成「图像理解 → 问题理解 → 跨模态推理 → 生成答案」的完整链路。
- 输入:一张图像 + 一个自然语言问题(如「图中有几只猫?」)
- 输出:自然语言答案(如「3」或「是的」),可以是开放式或多选式
- 难度来源:需要识别对象、理解空间关系、执行计数、推理因果,任意一环失败即答错
- 地位:长期作为多模态模型的核心评测基准,覆盖感知、推理、常识等多类能力
工作原理
现代 VQA 模型通常采用「视觉编码器 + 语言编码器 + 跨模态融合」三段架构。
- 视觉编码:用 CNN(如 ResNet)或 ViT 提取图像特征,得到视觉 token 序列
- 语言编码:用 Transformer(如 BERT)将问题编码为语义向量
- 跨模态融合:通过 交叉注意力(Cross-Attention) 让语言 token 关注相关图像区域,实现信息对齐
- 答案生成:早期模型将答案视为分类问题(从固定候选集选择);现代大模型(如 LLaVA、InternVL)直接自回归生成自由文本答案
- 端到端训练:现主流做法是将视觉编码器输出投影到语言模型的词嵌入空间,统一用语言模型解码
类型与变体
VQA 依据问题类型和任务设置衍生出多个子方向。
- 开放式 VQA:答案为任意自然语言文本,考查生成能力,代表数据集:VQAv2
- 二元 VQA(Yes/No):答案为「是/否」,常用于快速评估,但易受语言先验影响
- 计数型 VQA:要求精确数数,模型普遍薄弱的场景
- 文字型 VQA(TextVQA / DocVQA):图中含文字,需同时具备 OCR 能力
- 视频 VQA:输入由单张图扩展为视频片段,额外考查时序理解
- 医学 VQA(MedVQA):专注医学影像(X 光、MRI 等),答案准确性要求极高
应用场景
VQA 能力已渗透到多个产品形态。
- 无障碍辅助:帮助视觉障碍用户理解图像内容,如「图中路口是否有红绿灯?」
- 医疗影像问答:辅助医生快速查询影像特征,缩短诊断流程
- 电商图文检索:用户上传商品图并提问,系统直接返回属性或比价结果
- 教育与考试辅助:自动解答含图题目(数学几何、科学图表)
- 具身智能:机器人结合摄像头视野与指令问答,实现场景理解与导航
与相邻概念的区别
VQA 常与几个相近任务混淆,以下逐一对比。
- VQA vs 图像描述(Image Captioning):描述是模型主动生成文本概括图像,VQA 是被动回答指定问题;前者无约束,后者强调精准响应
- VQA vs 视觉定位(Visual Grounding):定位任务要求输出目标的边界框坐标,VQA 输出文本答案;两者可以结合(如 Grounding VQA)
- VQA vs 多模态对话(Multimodal Chat):多模态对话是多轮交互,VQA 通常是单轮问答;现代大模型往往将 VQA 作为多模态对话能力的子集
- VQA vs OCR:OCR 专注从图中提取文字,VQA 的 TextVQA 变体则在此基础上还需理解和推理
局限与误区
VQA 模型存在几类系统性缺陷,需重点警惕。
- 语言先验偏差:模型可能无需真正看图,仅凭问题统计规律猜到高频答案(如「香蕉是什么颜色?」→「黄色」),VQAv2 数据集通过构造平衡样本对来缓解此问题
- 计数能力弱:视觉模型对精确计数困难,超过 5 个对象时误差明显
- 空间关系误判:「左边」「上方」「背后」等相对位置关系常被错误理解
- 幻觉(Hallucination):模型可能自信地描述图中不存在的对象或属性
- 评测局限:传统准确率指标对同义答案不鲁棒,评测结果可能高估实际能力
发展脉络
从早期分类头到今日大模型端到端生成,VQA 走过十余年演进。
- 2014:Malinowski & Fritz 发布 DAQUAR 数据集,是最早的视觉问答数据集,专注室内场景
- 2015:Antol、Agrawal 等人在 ICCV 发布 VQA 数据集(约 25 万张图、76 万问题),正式确立 VQA 任务标准
- 2017:VQAv2 发布,通过正负样本配对抑制语言先验;Bottom-Up Top-Down Attention(Anderson et al.)引入目标检测特征,显著提升性能
- 2019:ViLBERT、LXMERT 等双流预训练模型兴起,视觉-语言联合预训练成主流范式
- 2021:ViT 统一视觉表示,单流架构(如 SimVLM)开始替代双流
- 2023:LLaVA、MiniGPT-4 将 VQA 能力整合进大语言模型,端到端生成成主流;GPT-4V 展现强大零样本 VQA 能力
- 2024 至今:InternVL、Qwen-VL 等多模态大模型持续迭代,VQA 逐渐成为通用多模态能力的子集而非独立赛道
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「看图回答问题」
- 「多模态理解考试」
- 「图片 + 问题 → 答案」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
- 中级概念查看详解 →
视觉问答(VQA)系统如何实现?
VQA 将图像编码与问题编码融合(多用交叉注意力),再输出答案,可走分类或生成两条路线。
- 中级概念查看详解 →
多模态融合:早期融合、晚期融合与交叉注意力有何区别?
早期融合在输入级拼接、晚期融合各自编码再合并、交叉注意力让一模态做 Query 去查另一模态的 KV。
- 中级概念查看详解 →
多模态大模型(如 LLaVA)如何把图像接入 LLM?
用 CLIP 视觉编码器提取图像特征,经投影层映射到 LLM 词嵌入空间,作为视觉 token 与文本拼接送入 LLM。
- 高级场景查看详解 →
多模态(图文)微调中如何确保文本和图像数据的对齐质量?
高质量图文配对、表征对比对齐、防模态坍塌,并用检索/VQA 指标验证对齐效果。
延伸阅读
从知识库精选 3 篇文章,帮助深入理解该术语。
外部参考
维基百科:查看「VQA」词条本页内容为本站原创撰写;维基百科链接仅作延伸参考。
