核心要点

  • 定义 CV:从图像/视频自动提取语义信息

  • 类比人眼-脑通路:传感、预处理、识别

  • 指出差异:注意机制、三维理解、常识

  • 列举检测、分割、跟踪等任务

简要回答

计算机视觉(CV) 让机器从像素中理解场景,任务包括分类、检测、分割、跟踪。与人眼相似处在于层次特征提取;差异在于人具备注意、三维深度与常识,而 CV 系统依赖标注数据与算力,鲁棒性与泛化仍弱于人类。

标准回答

一、先给出结论和背景

  • 定义:计算机视觉研究如何使机器从数字图像/视频中获取高层次理解(对象、动作、场景、文字)。
  • 与人眼视觉类比:| 环节 | 人类 | 计算机 |
    |------|------|--------|
    | 传感 | 视网膜感光细胞 | 相机/CCD |
    | 低层处理 | 侧抑制、边缘检测 | 滤波、边缘算子 |
    | 中层 | 形状、运动感知 | CNN 中层特征 |
    | 高层 | 物体识别、语义 | 分类头、检测头 |
    | 注意 | 选择性关注 | 显著性、ROI、Transformer Attention |

二、拆开关键步骤和判断点

  • 相似点:层次处理;对边缘、纹理、形状敏感;利用上下文。
  • 差异点:1. 人眼立体视差天然 深度感知;单目 CV 需估计深度
  1. 人类样本效率极高;深度学习需大量标注
  2. 人类有世界常识与因果;CV 模型易「对抗样本」 fooled
  3. 颜色恒常性人脑更强

三、补上落地边界和取舍

面试里可以补一个视觉任务例子:计算机视觉 在分类、检测、分割或多模态理解里分别会影响数据增强、模型结构、指标选择和误检漏检分析。这样回答会比单独讲概念更像真实项目经验。

回答思路

  • 【定义】用一句话说清「什么是计算机视觉?它与人类视觉有何关系」

  • 【原理】讲清关键机制或步骤(2~3 点)

  • 【例子】举一个真实项目、论文或产品中的例子

  • 【对比】与易混淆概念或替代方案比较(如有)

  • 【收尾】总结适用场景 + 一个局限或风险

延伸学习

延伸阅读:CV 入门CNN 原理。术语:CNNViT。工具:OpenCV

常见误区

⚠️ 常见踩坑

误区一:容易答偏的地方:声称 CV 已全面超越人类视觉;忽略对抗样本与分布外泛化;混淆图像处理与 CV 高层语义。

追问

追问 1人类视觉哪些能力 CV 仍欠缺?

少样本新类别识别、复杂遮挡推理、物理常识(物体 permanence)、精细运动控制、跨模态(触听觉)整合。

追问 2CV 和神经科学互相借鉴的例子?

Hubel-Wiesel 感受野启发 CNN;注意力机制类比选择性注意;NeRF 与认知三维表征研究互有启发。

追问 3事件相机 vs 传统帧相机?

事件相机异步报告亮度变化,高动态范围、低延迟,利于高速运动;需新算法,与传统 CV pipeline 不同。

🔗 相似问题

同一考点的不同问法,换着练更稳

没找到想看的面试题?把你想看的告诉我们 →

延伸学习

按主题分类的相关资源,便于系统复习