核心要点
定义 CV:从图像/视频自动提取语义信息
类比人眼-脑通路:传感、预处理、识别
指出差异:注意机制、三维理解、常识
列举检测、分割、跟踪等任务
标准回答
一、先给出结论和背景
- 定义:计算机视觉研究如何使机器从数字图像/视频中获取高层次理解(对象、动作、场景、文字)。
- 与人眼视觉类比:| 环节 | 人类 | 计算机 |
|------|------|--------|
| 传感 | 视网膜感光细胞 | 相机/CCD |
| 低层处理 | 侧抑制、边缘检测 | 滤波、边缘算子 |
| 中层 | 形状、运动感知 | CNN 中层特征 |
| 高层 | 物体识别、语义 | 分类头、检测头 |
| 注意 | 选择性关注 | 显著性、ROI、Transformer Attention |
二、拆开关键步骤和判断点
- 相似点:层次处理;对边缘、纹理、形状敏感;利用上下文。
- 差异点:1. 人眼立体视差天然 深度感知;单目 CV 需估计深度
- 人类样本效率极高;深度学习需大量标注
- 人类有世界常识与因果;CV 模型易「对抗样本」 fooled
- 颜色恒常性人脑更强
三、补上落地边界和取舍
面试里可以补一个视觉任务例子:计算机视觉 在分类、检测、分割或多模态理解里分别会影响数据增强、模型结构、指标选择和误检漏检分析。这样回答会比单独讲概念更像真实项目经验。
回答思路
【定义】用一句话说清「什么是计算机视觉?它与人类视觉有何关系」
【原理】讲清关键机制或步骤(2~3 点)
【例子】举一个真实项目、论文或产品中的例子
【对比】与易混淆概念或替代方案比较(如有)
【收尾】总结适用场景 + 一个局限或风险
常见误区
⚠️ 常见踩坑
误区一:容易答偏的地方:声称 CV 已全面超越人类视觉;忽略对抗样本与分布外泛化;混淆图像处理与 CV 高层语义。
🔗 相似问题
同一考点的不同问法,换着练更稳
没找到想看的面试题?把你想看的告诉我们 →
延伸学习
按主题分类的相关资源,便于系统复习
