深度学习课程进阶中/EN4–8 周★ 51337 章可站内阅读
Hugging Face Audio Course
HF 官方 Transformers 音频 / 语音系统课
Hugging Face· 513 stars
Hugging Face 官方音频课程,系统讲解如何用 Transformer 处理语音与音频:从特征提取、数据集加载,到音频分类、自动语音识别(ASR)与语音合成(TTS)的建模和微调。官方中文与英文章节同仓,站内优先中文轨、可切换英文,是书架目前唯一覆盖音频 / 语音方向的正规体系课,适合想从「只会调视觉 / 文本模型」扩展到多模态音频能力的工程师。
语言说明:优先 chapters/zh-CN;可切换英文。
为什么收录 · 补齐书架上缺失的音频 / 语音系统课,官方双语同仓、结构完整,与 HF NLP / Agents 课形成多模态官方主线。
音频语音识别TransformerASRTTSHugging Face官方课
这本书强在哪
- HF 官方音频 / 语音 Transformer 课程,材料系统、更新活跃
- 中英章节齐全,官方双语同仓,站内优先中文轨
- 覆盖 ASR、音频分类、TTS 全链路实践,不止讲概念
- 与站内 HF NLP / Agents 课同属官方体系,可衔接进阶
建议怎么学
- 01先完成音频数据处理章节,跑通 pipeline 再进模型结构
- 02ASR / 音频分类微调章务必用自己的小数据集复现
- 03Transformer 基础不熟时,并行 d2l 或 HF NLP Course 补位
- 04语音落地方向再接 whisper / funasr 工具库实践
适合谁 / 前置
- Python 基础
- 了解 Transformer / 注意力基本概念
- 了解 Hugging Face 生态(Transformers / datasets)更佳
学完得到什么
- 掌握音频表示、特征提取与数据集处理基础
- 能跑通音频分类与 ASR pipeline,理解输入输出
- 理解 CTC / Seq2Seq / 分类头等音频 Transformer 结构
- 能微调 ASR 与音频分类模型并做评估
目录
来自站内阅读器镜像;点击章节直接阅读
chapter03 章
chapter17 章
chapter24 章
chapter36 章
chapter58 章
chapter67 章
chapter82 章
策展亮点章节
音频数据处理音频应用入门音频 Transformer 结构ASR 微调与评估语音合成与进阶认证与总结
55beb9b3(main)· 许可证 Apache License 2.0 (Apache-2.0)。 上游更新后可通过同步脚本刷新。