核心要点
描述统计总结已有数据,推断统计推广到总体
能各举常用方法
知道推断需要假设与不确定性量化
简要回答
描述统计用图表和汇总量刻画样本;推断统计用样本对总体参数或假设做结论,并量化不确定性。
标准回答
一、描述统计(Descriptive)
——「数据说了什么」:
- 集中趋势:均值、中位数、众数
- 离散:方差、标准差、IQR
- 可视化:直方图、箱线图、散点图
- 不超出样本本身
二、推断统计(Inferential)
——「样本能推广什么」:
- 参数估计:点估计 + 置信区间
- 假设检验:p 值、显著性
- 回归与建模:预测 + 推断系数
- 需要抽样假设、样本量、显著性水平
描述 推断 样本均值 x̄ 推断总体 μ 样本比例 推断总体比例 无概率陈述 有置信度/显著性
三、数据科学工作流
EDA(描述)→ 建模(推断/预测)→ 验证。见 概率论基础。
面试里如果出现公式,建议先说 描述统计与推断统计有何区别 解决的直觉问题,再解释变量含义和适用条件。最后补一个反例或边界,比如样本量不足、分布假设不成立、数值不稳定时应该怎么处理。
回答思路
【定义】用一句话说清「描述统计与推断统计」
【原理】讲清关键机制或步骤(2~3 点)
【例子】举一个真实项目、论文或产品中的例子
【对比】与易混淆概念或替代方案比较(如有)
【收尾】总结适用场景 + 一个局限或风险
常见误区
⚠️ 常见踩坑
误区一:容易答偏的地方:只罗列名词、不会举例;混淆相似概念;忽略工程约束(成本、延迟、数据质量)。不确定时应主动说明假设。
追问
追问 1:探索性数据分析 EDA 属于哪类?
主要是描述统计,但指导后续推断/建模假设(分布形态、异常值、缺失)。EDA 不直接做总体推广,但为推断打基础。
追问 2:预测和推断有什么区别?
推断关注参数/因果解释(β 是否显著);预测关注新观测 ŷ 的准确度。高预测精度不一定有可解释推断,反之亦然。
追问 3:大数据时代描述统计还不够吗?
全量数据时某些「总体参数」可直接计算,但仍有分布漂移、因果、反事实问题需推断框架;且很多场景本质上仍是样本(日志采样、用户子集)。
🔗 相似问题
同一考点的不同问法,换着练更稳
延伸学习
按主题分类的相关资源,便于系统复习
