"Uncensored" 模型的乐观偏差
2026 年 7 月 29 日,arxiv 发布新论文。
研究发现
| 对比 | 结果 |
|---|---|
| Uncensored 模型 | 更可观测地"乐观" |
| 基础模型 | 行为基线相对中性 |
| RLHF 影响 | 系统性改变行为 |
对 RLHF 的启示
- 对齐过程可能引入非预期的行为偏差
- "去审查"不等于"恢复原始行为"
- 模型评估需要多维度考量
AI Master 解读
核心事件
arxiv 新论文发现 "uncensored" 模型比基础模型更可观测地乐观。
行业影响
为什么重要: 这揭示 RLHF 对齐不仅是"去除有害输出",还可能系统性地改变模型的行为基线。对模型评估和选型有直接影响。
AI Master 建议
评估模型时不仅看安全性指标,还需关注行为偏差;在关键决策场景中使用多模型交叉验证。
📰 原始来源
https://arxiv.org