大模型课程进阶EN4–8 周17 章可站内阅读
Smol Course
HF 官方小模型对齐实战课:SFT / 评估 / DPO / RL
Hugging Face
Hugging Face 官方小模型对齐实战课程:用 SmolLM3 / SmolVLM2 在本地小算力上完整走一遍指令微调、评估、DPO 偏好对齐、视觉语言模型与强化学习微调。目标读者是「会调 API 但没亲手训过模型」的工程师——不追求复现大模型,而是用最小成本打通从数据到权重的对齐闭环。站内英文主轨,覆盖了书架里 minimind(中文全链路)与 llms-from-scratch(原理书)之间的实践空档。
语言说明:官方 units/en 主轨;另有 es/ja/ko/pt-br/vi 翻译,暂无官方中文轨。
为什么收录 · HF 官方、Apache-2.0、小算力可跑,是目前最系统的「小模型对齐实操课」,补齐书架 llm 层从原理到动手的中间段。
小模型对齐指令微调DPORLHF评估合成数据Hugging Face官方课
这本书强在哪
- HF 官方小模型对齐课程,围绕 SmolLM3 / SmolVLM2 展开,全部可在本地小算力跑通
- 课程结构:SFT → 评估 → 偏好对齐 → VLM → RL,是「会用 API → 会调模型」的直通路
- 强调动手:每个单元带可运行 notebook 与练习,且有公开 leaderboard 可提交
- Apache-2.0 开源、更新活跃,与站内 HF NLP / Agents / Audio 课同属官方体系
建议怎么学
- 01按单元顺序:Instruction Tuning 先跑通训练脚本,再进入评估与偏好对齐
- 02每单元改自己的数据集或超参,保留训练日志便于对比
- 03评估单元务必做自定义领域评估,别只跑通用 benchmark
- 04想补中文全链路:并行/后续接 minimind 或 self-llm;补原理接 llms-from-scratch
适合谁 / 前置
- Python 基础与命令行
- 了解 Transformer / 微调基本概念
- 单卡消费级 GPU 更佳(小模型也可 CPU 跑通)
学完得到什么
- 掌握指令微调(SFT)流程与 chat template 应用
- 能对自定义领域做评估并读懂 benchmark 差异
- 理解 DPO 等偏好对齐算法的训练与调参
- 了解小型视觉语言模型与强化学习微调的基本路径
目录
来自站内阅读器镜像;点击章节直接阅读
第 0 单元1 章
第 1 单元7 章
第 2 单元4 章
第 3 单元4 章
第 4 单元1 章
策展亮点章节
Instruction Tuning(指令微调)Evaluation(评估)Preference Alignment(偏好对齐 / DPO)Vision Language Models(视觉语言模型)Reinforcement Learning(强化学习微调)Synthetic Data(合成数据)
32dde01a(main)· 许可证 Apache License 2.0 (Apache-2.0)。 上游更新后可通过同步脚本刷新。