VQA(视觉问答)

VQA

看图回答问题

亦作、亦称:视觉问答 · Visual Question Answering

视觉问答(VQA)是一项要求模型同时理解图像内容与自然语言问题、并给出自由文本答案的多模态任务。它是衡量模型「看懂图 + 读懂问 + 跨模态推理」综合能力的经典基准。

概述

VQA 将计算机视觉与自然语言处理融合为单一任务,要求模型完成「图像理解 → 问题理解 → 跨模态推理 → 生成答案」的完整链路。

  • 输入:一张图像 + 一个自然语言问题(如「图中有几只猫?」)
  • 输出:自然语言答案(如「3」或「是的」),可以是开放式或多选式
  • 难度来源:需要识别对象、理解空间关系、执行计数、推理因果,任意一环失败即答错
  • 地位:长期作为多模态模型的核心评测基准,覆盖感知、推理、常识等多类能力

工作原理

现代 VQA 模型通常采用「视觉编码器 + 语言编码器 + 跨模态融合」三段架构。

  • 视觉编码:用 CNN(如 ResNet)或 ViT 提取图像特征,得到视觉 token 序列
  • 语言编码:用 Transformer(如 BERT)将问题编码为语义向量
  • 跨模态融合:通过 交叉注意力(Cross-Attention) 让语言 token 关注相关图像区域,实现信息对齐
  • 答案生成:早期模型将答案视为分类问题(从固定候选集选择);现代大模型(如 LLaVAInternVL)直接自回归生成自由文本答案
  • 端到端训练:现主流做法是将视觉编码器输出投影到语言模型的词嵌入空间,统一用语言模型解码

类型与变体

VQA 依据问题类型和任务设置衍生出多个子方向。

  • 开放式 VQA:答案为任意自然语言文本,考查生成能力,代表数据集:VQAv2
  • 二元 VQA(Yes/No):答案为「是/否」,常用于快速评估,但易受语言先验影响
  • 计数型 VQA:要求精确数数,模型普遍薄弱的场景
  • 文字型 VQATextVQA / DocVQA):图中含文字,需同时具备 OCR 能力
  • 视频 VQA:输入由单张图扩展为视频片段,额外考查时序理解
  • 医学 VQA(MedVQA):专注医学影像(X 光、MRI 等),答案准确性要求极高

应用场景

VQA 能力已渗透到多个产品形态。

  • 无障碍辅助:帮助视觉障碍用户理解图像内容,如「图中路口是否有红绿灯?」
  • 医疗影像问答:辅助医生快速查询影像特征,缩短诊断流程
  • 电商图文检索:用户上传商品图并提问,系统直接返回属性或比价结果
  • 教育与考试辅助:自动解答含图题目(数学几何、科学图表)
  • 具身智能:机器人结合摄像头视野与指令问答,实现场景理解与导航

与相邻概念的区别

VQA 常与几个相近任务混淆,以下逐一对比。

  • VQA vs 图像描述(Image Captioning):描述是模型主动生成文本概括图像,VQA 是被动回答指定问题;前者无约束,后者强调精准响应
  • VQA vs 视觉定位(Visual Grounding):定位任务要求输出目标的边界框坐标,VQA 输出文本答案;两者可以结合(如 Grounding VQA)
  • VQA vs 多模态对话(Multimodal Chat):多模态对话是多轮交互,VQA 通常是单轮问答;现代大模型往往将 VQA 作为多模态对话能力的子集
  • VQA vs OCR:OCR 专注从图中提取文字,VQA 的 TextVQA 变体则在此基础上还需理解和推理

局限与误区

VQA 模型存在几类系统性缺陷,需重点警惕。

  • 语言先验偏差:模型可能无需真正看图,仅凭问题统计规律猜到高频答案(如「香蕉是什么颜色?」→「黄色」),VQAv2 数据集通过构造平衡样本对来缓解此问题
  • 计数能力弱:视觉模型对精确计数困难,超过 5 个对象时误差明显
  • 空间关系误判:「左边」「上方」「背后」等相对位置关系常被错误理解
  • 幻觉(Hallucination):模型可能自信地描述图中不存在的对象或属性
  • 评测局限:传统准确率指标对同义答案不鲁棒,评测结果可能高估实际能力

发展脉络

从早期分类头到今日大模型端到端生成,VQA 走过十余年演进。

  • 2014:Malinowski & Fritz 发布 DAQUAR 数据集,是最早的视觉问答数据集,专注室内场景
  • 2015:Antol、Agrawal 等人在 ICCV 发布 VQA 数据集(约 25 万张图、76 万问题),正式确立 VQA 任务标准
  • 2017VQAv2 发布,通过正负样本配对抑制语言先验;Bottom-Up Top-Down Attention(Anderson et al.)引入目标检测特征,显著提升性能
  • 2019ViLBERTLXMERT 等双流预训练模型兴起,视觉-语言联合预训练成主流范式
  • 2021ViT 统一视觉表示,单流架构(如 SimVLM)开始替代双流
  • 2023LLaVAMiniGPT-4 将 VQA 能力整合进大语言模型,端到端生成成主流;GPT-4V 展现强大零样本 VQA 能力
  • 2024 至今InternVLQwen-VL 等多模态大模型持续迭代,VQA 逐渐成为通用多模态能力的子集而非独立赛道

常见误解

日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。

  • 「看图回答问题」
  • 「多模态理解考试」
  • 「图片 + 问题 → 答案」

相关术语

和本术语关联紧密的其他词条,便于串联理解。

🎯 考点练习

含该术语的高频面试题,含标准答案与追问。

延伸阅读

从知识库精选 3 篇文章,帮助深入理解该术语。

  1. 1

    多模态学习(三):多模态大模型与统一架构

    从图像到文本再到图像,理解跨模态生成的核心技术

  2. 2

    多模态学习(一):CLIP 视觉-语言预训练

    从对比学习到零样本分类,理解 CLIP 如何连接视觉与语言

  3. 3

    人脸检测与识别:MTCNN, ArcFace

    从人脸检测到身份识别,掌握面部识别的完整技术栈

外部参考

维基百科:查看「VQA」词条

本页内容为本站原创撰写;维基百科链接仅作延伸参考。