核心要点

  • 公式与性质

  • 数值稳定性

  • 温度对采样的影响

简要回答

Softmax 把任意实数向量变成概率分布;除温度 T 后,T→0 接近 argmax,T 大则分布更平,用于控制生成随机性。

标准回答

一、先把结论讲清楚

Softmax:p_i = exp(z_i) / Σ exp(z_j),输出 (0,1) 且和为 1。用途:分类输出层;Attention 权重归一化

二、拆开机制和判断点

数值稳定:减 max(z) 防 overflow。温度:p_i = exp(z_i/T) / Σ exp(z_j/T)。T<1 分布更尖(更确定);

三、补上例子、边界和取舍

T>1 更平(更随机)。LLM 采样时 temperature + top-p/top-k 共同控制创造性。训练时用交叉熵损失,等价于最大似然。

面试里如果出现公式,建议先说 Softmax 函数的作用是什么 解决的直觉问题,再解释变量含义和适用条件。最后补一个反例或边界,比如样本量不足、分布假设不成立、数值不稳定时应该怎么处理。

常见误区

⚠️ 常见踩坑

误区一:容易答偏的地方:只背概念不会举例;混淆相似术语;忽略工程落地约束(成本、延迟、数据质量)。

追问

追问 1Softmax 和 Sigmoid 关系?

题库专题:多分类与多标签分类有什么区别?Softmax 与 Sigmoid 怎么选?

Sigmoid 把标量压到 (0,1),二分类输出或多标签独立概率;Softmax 对向量归一化为和为 1 的分布,多分类互斥。二分类时 Softmax(2 维) 与 Sigmoid 等价(差一个常数平移)。

题库延伸:与本追问相关的专题题 → 多分类与多标签分类有什么区别?Softmax 与 Sigmoid 怎么选?

追问 2top-p 采样原理?

题库专题:解码时 Temperature、Top-k、Top-p 采样有什么区别?

按概率从高到低累加,直到累计概率 ≥ p,只在该核内重新归一化后采样。动态截断低概率尾,比固定 top-k 更适应分布形态,平衡多样性与连贯性。

题库延伸:与本追问相关的专题题 → 解码时 Temperature、Top-k、Top-p 采样有什么区别?

🔗 相似问题

同一考点的不同问法,换着练更稳

延伸学习

按主题分类的相关资源,便于系统复习