大模型课程高阶英文1–2 周(跟视频 + 复现)★ 5.4k1 章可站内阅读
Build nanoGPT
Karpathy:从空文件手搓到 GPT-2 124M
Andrej Karpathy · 5,413 stars
Andrej Karpathy 的 nanoGPT 构建课:用干净的 git 提交历史与配套视频,带你从空文件走到可复现的 GPT-2(124M)训练管线。适合已经会一点深度学习、想真正「手搓」语言模型训练的人。
为什么收录 · 实现向 LLM 课的标杆之一:视频 + commit 回放,补齐站内「训练手搓」短路径。
nanoGPTGPT-2从零实现训练管线PyTorch视频课
这本书强在哪
- 提交历史刻意保持干净,可逐步回放「模型如何被写出来」
- 配套 YouTube 长视频讲解,学习体验完整
- 目标清晰:复现 GPT-2 124M,而不是空谈架构名词
- 与 nn-zero-to-hero、rasbt 形成 Karpathy / 实现向学习链
建议怎么学
- 01先看完对应视频再按 commit 回放,不要跳步抄最终文件
- 02在小规模数据上先跑通,再考虑完整复现
- 03把每个关键超参改动的效果记进实验笔记
- 04前后衔接:先 nn-zero-to-hero 打底,后 rasbt / MiniMind 扩展
适合谁 / 前置
- 扎实 Python 与 PyTorch
- 理解基本神经网络与训练循环
- 有云 GPU 预算更佳(复现 GPT-2 级实验)
学完得到什么
- 能沿着 commit 历史理解 GPT 训练管线如何长出来
- 亲手复现 nanoGPT / GPT-2 124M 量级训练流程
- 建立对数据、tokenizer、训练配置的工程直觉
- 为阅读更大开源训练代码打下底子
目录
来自站内阅读器镜像;点击章节直接阅读
完整教程1 章
策展亮点章节
从空文件起步数据与 tokenizer模型与训练循环优化与规模化线索复现 GPT-2 124M
仓库数据
Stars5,413
Forks878
主要语言Python
创建2024/6/9
更新2024/8/13
6104ab1b(master)· 许可证 需人工确认 (NOASSERTION)。 上游更新后可通过同步脚本刷新。