DeepSeek-R1 发表于 Nature
2025 年 9 月 17 日,DeepSeek-R1 论文发表于 Nature(Volume 645, Pages 633-638)。
核心贡献
- GRPO 算法:无需价值网络,训练成本降低 50%
- RLVR:用可验证奖励替代人类偏好
- 纯 RL 训练:无需 SFT 预热也能产生推理能力
AI Master 解读
核心事件
DeepSeek-R1 论文发表于 Nature,标志着开源推理模型的里程碑。
行业影响
影响分析: 首次证明纯 RL 训练(无需 SFT 预热)可产生推理能力。GRPO 算法简化训练流程(4 模型→2 模型),开源社区可复现。
AI Master 建议
GRPO 已成为推理模型训练的标准算法,值得深入理解。
