一、手册概述
1.1定位与适配场景
本手册适配AI标准化自学路线前置阶段:LLM必备数学基础回顾,对应学习计划「阶段0~3数学前置」,完整沉淀math_prelude/目录下五大核心模块的全部公式推导逻辑。
区别于纯理论数学教材,本手册主打LLM工程落地导向:每一个公式均遵循推导过程→ Python代码验证→示例数据结果→ LLM模型关联的四维讲解逻辑,彻底打通「数学理论→代码实现→大模型底层原理」的闭环。
1.2标准学习方法(实操必看)
拒绝死记硬背,采用「纸笔实操+代码验证」的闭环学习法:
- 第一步:纸笔推导:独立手写公式推导全过程,夯实底层逻辑;
- 第二步:代码运行:执行对应模块Python代码,对照数值结果;
- 第三步:手册核对:复盘推导逻辑、修正误区,关联LLM落地场景。
二、核心模块一:线性代数核心(LLM张量运算基石)
对应代码模块:linear_algebra.py
线性代数是Transformer、向量嵌入、注意力机制的运算基础,所有模型的张量变换、权重计算均基于本章原理。
2.1矩阵乘法与维度匹配规则
核心公式
推导逻辑
维度约束:仅当矩阵A(m×k)的内维k与矩阵B(k×n)的内维相等时,乘法合法;
输出结果:最终得到 m×n 维度矩阵;
物理含义:结果矩阵第i行j列元素 = A的第i行向量与B的第j列向量的内积;
报错本质:维度不匹配的核心原因是两个向量长度不一致,内积无数学定义。
示例验证
2×3矩阵 × 3×2矩阵 → 输出2×2矩阵
运算结果:
核验:,与代码运行结果一致。
LLM落地关联
Transformer中Q·Kᵀ、权重矩阵变换W_Q·x、FFN两层线性映射均为矩阵乘法;维度匹配规则是理解注意力张量形状(n×d、n×n、n×dᵥ)的核心前提。
2.2转置、单位矩阵、对角矩阵
核心公式
- 矩阵转置:
(行列互换)
- 单位矩阵:
- 对角矩阵:
核心性质推导
- 单位矩阵特性:
,等价于乘法中的「1」;
- 转置核心性质:
(顺序颠倒),是注意力公式形状推导的核心依据。
LLM落地关联
RoPE旋转位置编码依赖块对角旋转矩阵;注意力打分机制通过 实现批量行×列内积运算。
2.3向量内积/外积
核心公式
- 内积(标量输出):
- 外积(矩阵输出):
推导核心
内积的本质是衡量两个向量的方向相似度:当向量为单位向量时,内积直接等于夹角余弦值,是余弦相似度的数学本源。
示例验证
向量
内积: