核心要点
公式与性质
数值稳定性
温度对采样的影响
简要回答
Softmax 把任意实数向量变成概率分布;除温度 T 后,T→0 接近 argmax,T 大则分布更平,用于控制生成随机性。
标准回答
一、先把结论讲清楚
Softmax:p_i = exp(z_i) / Σ exp(z_j),输出 (0,1) 且和为 1。用途:分类输出层;Attention 权重归一化。
二、拆开机制和判断点
数值稳定:减 max(z) 防 overflow。温度:p_i = exp(z_i/T) / Σ exp(z_j/T)。T<1 分布更尖(更确定);
三、补上例子、边界和取舍
T>1 更平(更随机)。LLM 采样时 temperature + top-p/top-k 共同控制创造性。训练时用交叉熵损失,等价于最大似然。
面试里如果出现公式,建议先说 Softmax 函数的作用是什么 解决的直觉问题,再解释变量含义和适用条件。最后补一个反例或边界,比如样本量不足、分布假设不成立、数值不稳定时应该怎么处理。
常见误区
⚠️ 常见踩坑
误区一:容易答偏的地方:只背概念不会举例;混淆相似术语;忽略工程落地约束(成本、延迟、数据质量)。
追问
追问 1:Softmax 和 Sigmoid 关系?
题库专题:多分类与多标签分类有什么区别?Softmax 与 Sigmoid 怎么选?Sigmoid 把标量压到 (0,1),二分类输出或多标签独立概率;Softmax 对向量归一化为和为 1 的分布,多分类互斥。二分类时 Softmax(2 维) 与 Sigmoid 等价(差一个常数平移)。
题库延伸:与本追问相关的专题题 → 多分类与多标签分类有什么区别?Softmax 与 Sigmoid 怎么选?
追问 2:top-p 采样原理?
题库专题:解码时 Temperature、Top-k、Top-p 采样有什么区别?按概率从高到低累加,直到累计概率 ≥ p,只在该核内重新归一化后采样。动态截断低概率尾,比固定 top-k 更适应分布形态,平衡多样性与连贯性。
题库延伸:与本追问相关的专题题 → 解码时 Temperature、Top-k、Top-p 采样有什么区别?
🔗 相似问题
同一考点的不同问法,换着练更稳
延伸学习
按主题分类的相关资源,便于系统复习
