线性代数

线性代数

AI 的数学基础

线性代数是研究向量空间、矩阵与线性变换的数学分支,是现代 AI 的底层数学语言。从神经网络的前向传播到 Transformer 的注意力计算,几乎所有深度学习操作都建立在矩阵运算之上。

概述

线性代数是研究向量空间、矩阵与线性变换的数学分支,是现代 AI 的底层数学语言。从神经网络的前向传播到 Transformer 的注意力计算,几乎所有深度学习操作都建立在矩阵运算之上。

核心对象

线性代数围绕几类基本数学对象展开,每类在 AI 中都有直接对应。

  • 标量(Scalar):单个实数,如学习率、温度参数等超参数均为标量
  • 向量(Vector):有序数组,既可表示空间方向,也可表示词语的语义(即 Embedding)
  • 矩阵(Matrix):二维数组,用于存储权重参数、注意力分数等;1848 年 Sylvester 正式引入「矩阵」一词,1855 年 Cayley 建立矩阵乘法体系
  • 张量(Tensor):矩阵的多维推广,深度学习框架中数据与参数的通用存储形式
  • 线性映射(Linear Map):保持加法与标量乘法结构的函数,神经网络每一线性层本质上即线性映射

关键运算

以下运算在 AI 研究和工程中出现频率最高。

  • 矩阵乘法:GPU 并行架构专为大规模矩阵乘法优化,是深度学习依赖 GPU 的根本原因;矩阵乘法不满足交换律(AB≠BA)
  • 内积与余弦相似度:衡量两向量方向相似度;Transformer 中注意力分数 QKᵀ/√d 本质上是批量内积
  • 特征值分解(EVD):将方阵分解为 A=QΛQ⁻¹,PCA 借此从协方差矩阵中提取主成分
  • 奇异值分解(SVD):EVD 的泛化,适用于任意形状矩阵;LoRA 低秩适配的数学依据正是将大矩阵近似为两个低秩矩阵之积
  • 雅可比矩阵:反向传播本质是链式雅可比矩阵连乘,批量计算时以矩阵形式高效实现

几何直觉

把矩阵理解为「空间变换机器」,有助于建立线性代数的几何直觉。

  • 旋转与拉伸:矩阵乘以向量,相当于把该向量旋转、拉伸或压缩到新位置
  • 特征向量:经过变换后方向不变、只被缩放的特殊向量;对应的缩放因子是特征值
  • PCA 的本质:找数据协方差矩阵的特征向量(方差最大方向),特征值越大,该方向解释的方差越多
  • 非线性来自激活函数:矩阵本身只能做线性操作,ReLU、GELU 等激活函数叠加后才使网络具备拟合非线性结构的能力
  • 高维反直觉:嵌入空间动辄数百至数千维,三维下的几何直觉在高维常常失效,需谨慎外推

在 Transformer 中的体现

Transformer 是线性代数应用最密集的现代架构之一。

  • 投影变换:Q、K、V 矩阵分别由输入乘以三个权重矩阵得到,是标准线性变换
  • 注意力分数:计算 QKᵀ / √d 并经 Softmax 归一化,核心是高维矩阵点积
  • 多头注意力:将向量空间拆分为多个子空间分别做注意力再拼接,体现子空间分析思想
  • 前馈网络(FFN):两层线性变换夹一个非线性激活,参数量占 Transformer 总量约 2/3
  • 位置编码:正弦/余弦编码或旋转编码(RoPE)本质上是在向量空间中引入位置信息的线性操作

发展脉络

线性代数经历了从古代具体解方程到现代抽象向量空间的漫长演化。

  • 约公元前 200 年:中国古算书《九章算术》记载用矩形数表(方程组)求解联立方程,是最早的线性方程组方法文献之一
  • 1637:笛卡尔建立坐标几何,为用代数描述几何空间奠定基础
  • 1693:莱布尼茨发展行列式理论,系统研究线性方程组的可解性(部分史学家认为日本数学家关孝和更早独立提出)
  • 1750:Gabriel Cramer 重新发现行列式并给出「Cramer 法则」
  • 1848:J.J. Sylvester 正式引入「matrix(矩阵)」一词
  • 1855:Arthur Cayley 定义矩阵乘法,奠定矩阵代数基础(代表论文发表于 1858 年)
  • 1888:Giuseppe Peano 给出向量空间的第一个现代公理化定义
  • 2017:Transformer 论文「Attention Is All You Need」将注意力机制表达为矩阵乘法序列,线性代数成为 LLM 核心运算语言

常见误区

学习或使用线性代数时,以下误区值得特别注意。

  • 矩阵乘法不可交换:AB≠BA,推导梯度时若忽略乘法顺序会导致维度错误
  • Sylvester 命名与 Cayley 建立代数体系的区别:前者于 1848 年引入「矩阵」一词,后者于 1855/1858 年建立矩阵代数,两者贡献常被混淆
  • 高维直觉失效(维数灾难):数百维空间中几乎所有点对之间的距离趋于相等,基于距离的方法效果会退化
  • 数值稳定性:矩阵条件数过大会导致求逆不稳定,实践中常用伪逆或正则化替代精确求逆
  • 线性代数并非唯一数学基础:概率论、微积分、信息论同样是 AI 的必备基础,不可偏废

常见误解

日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。

  • 「AI 的数学基础」
  • 「学 AI 躲不过的数学」
  • 「跟 线性代数 是一回事吗」

相关术语

和本术语关联紧密的其他词条,便于串联理解。

🎯 考点练习

含该术语的高频面试题,含标准答案与追问。

延伸阅读

从知识库精选 2 篇文章,帮助深入理解该术语。

  1. 1

    线性代数:向量与矩阵

    从向量空间到矩阵运算,掌握 AI 所需的线性代数基础

  2. 2

    入门基础学习导览:数学与机器学习

    **AI 学习的起点**。从线性代数、概率论到回归、分类、聚类,打下扎实的 AI 基础。不必成为数学专家,但要理解核心概念。

外部参考

维基百科:查看「线性代数」词条

本页内容为本站原创撰写;维基百科链接仅作延伸参考。