Skip to content

第3章 · 大模型核心数学桥接与符号解码速查 ​

前置要求:建议先阅读 第2章 · 面向大模型的现代 Python 与张量工程底座。本章专为初级工程师梳理大模型所需的 15 个核心数学符号与几何直觉,数学难度严格控制在高中范围内。


本章核心定位与即用即学(Just-In-Time)声明 ​

TIP

初级前端工程师数学解惑声明(代码即数学)

很多开发者对深度学习望而却步,不是因为逻辑复杂,而是被密密麻麻的古希腊数学符号吓退。

数学符号本质上是数学家发明的“极简代码宏”,所有高深公式在计算机里都是数组循环、对象变换与切片投影:

  • ∑ 就是前端天天写的 arr.reduce((s, x) => s + x, 0);
  • 向量点积就是两个数组对应位置相乘再累加,衡量的是语义上的“默契度”;
  • 偏导数就是调音台上按住其他旋钮不动、单动一个旋钮对刺耳噪音(Loss)的影响;
  • Softmax 就是消除负数后的百分比归一化。

本章唯一使命:一次性建立贯穿全书的核心数学与物理直觉,提供随查随用的符号字典与概念图谱。学完本章,你将自信步入第 4 章手搓自动微分引擎!

本章目标 ​

学完本章核心内容后你能做到:

  1. 熟练查阅并解释大模型 15 大核心数学符号的读音、高中原型、JS 等价实现与大模型物理意义。
  2. 用中心差商公式解释数值近似导数与 gradcheck 对拍契约,直观解释多变量偏导数与链式法则路径累加机制。
  3. 手算 2×2 矩阵乘法,解释向量点积与余弦相似度的等价性及其在注意力机制中的物理作用。
  4. 解释 Softmax 的平移不变性与数值溢出防御原理,口头讲透交叉熵损失与负对数似然(NLL)的数学联系。
  5. 熟练复述全书最核心的“5 行神经网络训练循环骨架”。

阶段一:深度学习全量数学符号解码字典(15 大核心符号) ​

IMPORTANT

专为高中数学背景定制的符号放大镜

遇到论文或教材中的公式时,随时翻阅下表对照。只要将数学符号映射为 JavaScript 代码,一切神秘感将荡然无存:

数学符号标准读音与名称高中数学原型 / 几何直觉JavaScript 代码等价表达大模型中的实际物理意义
∑i=1NxiSigma / 求和号数列求和 Sn=a1+⋯+anarr.reduce((s, x) => s + x, 0)矩阵乘法行列加权求和、Softmax 分母累加
∏t=1TptPi / 连乘号独立事件概率连乘 P1×P2arr.reduce((p, x) => p * x, 1)自回归模型生成一整句话的联合概率
∇θLNabla / 梯度算子导数 f′(x) 扩展到多元向量{ w1: dL_dw1, w2: dL_dw2 }汇总全网络所有旋钮该朝哪个方向调节才能降 Loss
∂L∂wPartial / 偏导数导数 dydx(弯曲 d 代表多元)只改动单个入参时的瞬时变化率调音台上固定其他旋钮,单动当前旋钮对刺耳声的直接影响
A⊤ 或 ATTranspose / 转置沿对角线翻转矩阵A[0].map((_, c) => A.map(r => r[c]))旋转矩阵行列,使 Key 能与 Query 进行行对列的点积
a⊙bHadamard / 逐元素积两个相同长度数组对应位置相乘a.map((v, i) => v * b[i])门控机制(如 SwiGLU 激活、Dropout 掩码过滤)
A@B 或 ABMatmul / 矩阵乘法批量空间投影与坐标变换嵌套循环对每行每列求点积线性变换全连接层(特征升维、降维与跨通道融合)
y∝xProportional / 正比于存在常数 k 使得 y=k⋅xy = k * x未归一化概率打分(只比大小,省去计算昂贵的分母归一化常数)
arg⁡maxxf(x)Argmax / 极值自变量找出使函数最大的自变量 x(非最大值)arr.reduce((maxI, v, i, a) => v > a[maxI] ? i : maxI, 0)贪婪生成采样:从成千上万个 Token 中选概率最大的那个 ID
Ex∼P[f(x)]Expectation / 数学期望按概率加权的平均数samples.reduce((acc, s) => acc + s.p * s.val, 0)强化学习期望回报 J(θ)、批处理样本平均损失
ln⁡(x) / log2⁡(x)Logarithm / 对数高中对数函数,把乘法连乘化为连加Math.log(x) / Math.log2(x)信息熵计算、交叉熵损失、防止连乘浮点下溢
|W|FFrobenius Norm / 矩阵范数高中二维向量模长 x2+y2 的多维版Math.hypot(...matrix.flat())量化网络权重的整体体量,梯度裁剪(Gradient Clipping)防发散
softmax(z)Softmax / 归一化指数指数拉伸后除以总和exp(z_i) / sum(exp(z))将任意正负 Logits 转换为概率和为 1 的概率分布
ϵEpsilon / 极小正数极限微小量(如 10−5)1e-5杜绝除以零崩溃(LayerNorm、AdamW 内部的安全保护底限)
θTheta / 参数集高中角标变量,在深度学习指全网参数{ weights, biases }整个大模型所有可学习矩阵的统称总代号

阶段二:微积分与敏感度分析(第 4 章自动微分地基) ​

IMPORTANT

第 4 章手写 Value 的直接前置基础

第 4 章实现标量计算图与反向传播,唯一消费的微积分工具就是本阶段的四项内容:

  1. 中心差商:用于 gradcheck 与你手写的反向传播对拍;
  2. 偏导数:多权重下的单个参数责任分摊;
  3. 梯度向量:所有偏导数打包的建议方向;
  4. 标量链式法则:复合运算沿路径相乘、分叉路径梯度累加 +=。

1. 导数与中心差商 ​

导数度量的是函数在某点的瞬时变化率。在计算机中,我们使用有限差分中心差商进行数值近似:

f′(x)≈f(x+h)−f(x−h)2h,h≈10−5

例:对于 f(x)=x3,在 x=2 处的理论导数真值为 3x2=12。若取 h=10−5,算得的中心差商误差在 10−9 以内! 在第 4 章中,gradcheck 就是用这个公式作为终极客观真理,来对拍你手写的反向传播梯度——如果两边对不上,说明反向传播闭包公式写错了。

为什么 h 不能无限小(例如 10−16)? 浮点数在计算机中精度有限,当 h 过小时,分子中两个极度接近的数字相减会发生灾难性的有效数字抹除(Catastrophic Cancellation),计算结果将全被浮点噪声污染。因此工程上通常取 10−5 到 10−7。

在线实验 02

中心差商数值导数与对拍演练

中心差商 [f(x + h) - f(x - h)] / (2h) 通过在目标点两侧对称采样,让泰勒展开中的二阶误差项相互抵消,达到 O(h²) 极高逼近精度。滑动下方的步长 h,观察割线如何完美收敛于真实切线。

选择测试函数:
解析切线斜率 (真实导数): 12.000000
中心差商割线斜率 (近似导数): 12.000000
解析真实导数 f'(x)12.00000000通过微积分法则直接推导
中心差商数值导数12.00000000 绝对误差: 2.118e-10
前向差商 (单侧采样)12.00006000 绝对误差: 6.000e-5 (比中心差商大 283235 倍)

2. 偏导数:固定其他变量,只看当前变量 ​

神经网络的损失函数由成百上千亿个参数共同决定。偏导数就是固定其他所有参数不动,只微调当前参数时,损失函数的瞬时响应:

∂f∂x=limh→0f(x+h,y)−f(x,y)h∂f∂y=limh→0f(x,y+h)−f(x,y)h

例:f(x,y)=x2+3xy+y2,在点 (1,2) 处:

  • 对 x 求偏导(视 y 为常数):∂f∂x=2x+3y=2(1)+3(2)=8
  • 对 y 求偏导(视 x 为常数):∂f∂y=3x+2y=3(1)+2(2)=7

几何直觉:曲面切点处的两条切线斜率拼在一起,构成了该点的切平面:

曲面切点处的两条切线与切平面:固定 y 方向的切线斜率就是 ∂f/∂x,固定 x 方向就是 ∂f/∂y

3. 梯度向量 ∇f 与最陡方向 ​

把各个变量的偏导数打包成一个向量,就是梯度:

∇f=[∂f∂x∂f∂y]

物理第一性原理:梯度向量的方向永远是函数增长最快(最陡峭)的方向;它的反方向 −∇f 就是下山最快的方向!

4. 多变量链式法则与逆拓扑序 ​

对复合函数 z=f(g(x,y),h(x,y)),链式法则规定:

∂z∂x=∂z∂g⋅∂g∂x+∂z∂h⋅∂h∂x

IMPORTANT

计算图两大铁律:

  1. 分叉路径梯度累加 +=:x 同时经过 g 和 h 两条路径影响输出 z,反向传播时来自两条路径的梯度贡献必须相加,绝对不能覆盖!
  2. 反向传播必须严格按照逆拓扑序执行:必须等下游所有消费了当前节点的算子全部传回梯度后,当前节点才能安全地把梯度继续向上传递。

阶段三:线性代数与空间映射(注意力与表征基石) ​

1. 向量点积与余弦相似度(语义对齐本质) ​

向量的点积定义为对应分量乘积之和:

a⋅b=∑iaibi=|a||b|cos⁡θ

变形可得两向量的夹角余弦:

cos⁡θ=a⋅b|a||b|

当向量进行 L2 模长归一化(|a|=1,|b|=1)后,点积严格等于余弦相似度:

  • +1.0:方向完全重合,语义 100% 相同;
  • 0.0:正交垂直,语义毫不相关;
  • -1.0:方向完全相反,语义彻底对立。

这正是第 8 章 Transformer 注意力 QK⊤ 衡量不同词之间的关联度,以及第 13 章 RAG 向量数据库匹配文档与提问语义的统领性数学原理。

2. 矩阵乘法:批量坐标空间映射 ​

手算 2×2 矩阵乘法,牢记“左行乘右列”:

[1234]@[5678]=[1⋅5+2⋅71⋅6+2⋅83⋅5+4⋅73⋅6+4⋅8]

逐项求值:

[1⋅5+2⋅71⋅6+2⋅83⋅5+4⋅73⋅6+4⋅8]=[19224350]

Shape 消解铁律:(M,K)@(K,N)→(M,N),中间维 K 必须相等,结果保留左行与右列。 转置公式:(AB)⊤=B⊤A⊤。

3. 条件数、病态矩阵与损失地形峡谷 ​

  • Frobenius 矩阵范数:∥A∥F=∑i,jAij2,衡量权重矩阵的总体体量大小。
  • 条件数 κ(A)=σmaxσmin:
    • 良态矩阵(κ≈1):输入扰动,输出等比例响应;
    • 病态矩阵(κ≫1):几何呈极端细长椭圆。在优化过程中,对应极度险峻的狭长峡谷地形(两侧悬崖极陡,谷底极平缓)。普通梯度下降会在悬崖间剧烈震荡,无法前进——这正是必须引入**动量(Momentum)**与自适应步长(AdamW)的数学原动力!

4. SVD 奇异值分解与低秩近似(LoRA 与 MLA 的数学根基) ​

任何实数矩阵 A∈Rm×n(秩为 R)均可精确分解为正交阵与对角阵的连乘:

A=UΣV⊤=∑i=1Rσiuivi⊤

其中:

  • U∈Rm×m 与 V∈Rn×n 均为正交矩阵(U⊤U=I,V⊤V=I),分别代表输出空间与输入空间的正交基底旋转;
  • Σ∈Rm×n 为对角矩阵,对角线上的奇异值按降序排列:σ1≥σ2≥⋯≥σR>0,代表沿各个主轴方向的几何拉伸尺度。

几何直觉:SVD 表明任何线性变换在几何上都等价于三部曲:空间正交旋转(V⊤)→ 沿轴独立拉伸(Σ)→ 再次正交旋转(U)。

IMPORTANT

Eckart-Young-Mirsky 定理(最优低秩逼近定理)

若我们仅保留前 r<R 个最大奇异值,构造截断矩阵 Ar=∑i=1rσiuivi⊤,则 Ar 是在所有秩不超过 r 的矩阵中,对原矩阵 A 的全局最优逼近(在 Frobenius 范数与谱范数意义下):

minrank(B)≤r∥A−B∥F=∥A−Ar∥F=∑i=r+1min(m,n)σi2

大模型第一性原理映射:

  1. 为什么 LoRA 能够生效? 自然语言任务中,数千维的大模型权重矩阵虽然在形式上是满秩的,但其有效奇异值谱系呈现出极陡峭的指数级衰减(即“内在维度 Intrinsic Dimension”极低)。因此,第11章 · LoRA 微调 用两个低秩小矩阵 BD×rAr×D(如 r=8 或 16)逼近全量微调增量 ΔW,能够以低于 1% 的参数量达成 99% 的全参数微调性能!
  2. 为什么 DeepSeek MLA 能够极限压缩 KV Cache? 第12章 · DeepSeek 架构 的多头潜在注意力(MLA),本质上就是利用低秩投影矩阵将庞大的 Key/Value 状态压缩为一个低维隐向量 ctKV,在服务时仅需缓存这一紧凑隐变量,其代数可行性完全建立在低秩流形近似之上。

5. 矩阵微积分:分母布局契约与梯度张量同构 ​

在阅读算法论文与编写 PyTorch 代码时,初学者常因维度转置而困惑。其根源在于数学文献中的两套布局约定:

约定体系标量关于矩阵导数 ∂L∂W 的 Shape典型应用领域
分子布局(Numerator Layout)若 W∈RM×N,导数排布为 (N×M)(转置形式)纯数学分析、控制论
分母布局(Denominator Layout)严格等于 W 的原始形状 (M×N)机器学习、PyTorch、深度学习系统

TIP

深度学习系统的梯度同构铁律

在大模型工程与本书后续所有实现中,一律严格遵循分母布局契约:

shape(∂L∂W)≡shape(W)

为什么必须同构? 考虑梯度下降更新公式:W←W−η⋅∇WL。只有当梯度矩阵与权重矩阵具有完全相同的形状时,两个张量才能进行原位逐元素相减,无需任何隐式转置或广播!这构成了后续所有张量求导与反向传播的底层契约。


阶段四:概率统计与信息论速查 ​

1. 条件概率与贝叶斯定理 ​

P(A∣B)=P(A∩B)P(B),P(H∣E)=P(E∣H)P(H)P(E)
  • P(H) 为先验信念,P(E∣H) 为似然证据,P(H∣E) 为观测数据后的后验概率。

2. Softmax 函数与玻尔兹曼物理分布 ​

将实数分数 Logits 转换为和为 1 的概率分布:

pi=softmax(zi)=ezi/T∑j=1Kezj/T
  • 调节参数 T 就是物理世界的热力学温度:
    • T→0:绝对零度“淬火”,概率坍缩到最大值(贪婪采样);
    • T→∞:高温剧烈热运动,所有词概率均等化(随机发散)。

CAUTION

工业级稳定 Softmax:平移不变性与防上溢证明

在 float32 中,zi>88.7 时 ezi 就会溢出为 inf。 利用平移不变性:分子分母同时除以 eC:

ezi∑ezj=ezi−C∑ezj−C

取 C=max(z),则所有指数项 zi−max(z)≤0,最大指数为 e0=1,彻底杜绝浮点上溢崩溃!

python
def stable_softmax(z, temperature=1.0):
    scaled = z / temperature
    shifted = scaled - np.max(scaled, axis=-1, keepdims=True)
    exp_z = np.exp(shifted)
    return exp_z / np.sum(exp_z, axis=-1, keepdims=True)

3. 全期望公式(塔式性质 / Tower Property) ​

E[X]=EY[EX∣Y[X∣Y]]

类比高中计算全校平均分:先分别算出高一、高二各年级的局部平均分,再按人数比例加权平均。 在大模型强化学习(PPO / GRPO)中,总期望目标可严格拆分为外层抽样 Prompt 与内层抽样模型回答两级独立期望。

4. 信息论核心指标 ​

  • 自信息:I(x)=−log2⁡P(x)(越罕见的事件信息量越大);
  • 香农熵:H(X)=−∑P(x)log2⁡P(x)(量化随机变量的不确定性);
  • KL 散度:DKL(P∥Q)=∑P(x)log2⁡(P(x)/Q(x))(量化两个分布之间的差异);
  • 交叉熵损失:H(P,Q)=−∑P(x)log2⁡Q(x)=H(P)+DKL(P∥Q)。当标签为 one-hot 时,H(P)=0,最小化交叉熵等价于最小化预测与真值之间的 KL 散度!
  • 困惑度(Perplexity):PP=2H,直观含义是模型预测下一个词时平均在多少个候选词中纠结。

5. 无偏估计:GRPO 偏置论证的语言地基 ​

用样本数据算出、用来逼近真参数 θ 的统计量叫估计量 θ^("hat"帽子记号标记"这是由样本算出的估计版")。它的第一条质量判据是无偏性(unbiasedness):

Bias(θ^)=E[θ^]−θ,θ^ 无偏⟺E[θ^]=θ

直觉:单次估计必然受抽样运气影响而偏移,无偏性只承诺"反复采样重算、再取平均,平均意义上恰好落在真值"。全书高频的一批论证全部踩在这个定义上:第11章的"组均值基线不改变期望——无偏"、蒙特卡洛回报"无偏但高方差"、Dr. GRPO 把 GRPO 目标修正为按 N−1N 缩放的无偏策略梯度(GRPO 的偏置与修正)——届时都回到这一行公式。

6. 方差、协方差与常见分布速查(初始化与 RL 推导的工作马) ​

恒等式内容用在哪
方差计算式Var(X)=E[X2]−(E[X])2第7章 Xavier/He 初始化的方差守恒推导
线性变换Var(aX+b)=a2Var(X)缩放系数为什么取 1/fan-in 量级而不是 1/fan-in
独立期望分解X,Y 独立 ⇒E[XY]=E[X]E[Y]baseline 无偏性论证所依赖的期望线性性
协方差Cov(X,Y)=E[XY]−E[X]E[Y]独立 ⇒ 零相关;反之不成立(零相关只排除线性关联)

常见分布三行表(LLM 视角):

分布PMF / PDF期望 / 方差在大模型里它是谁
Bernoulli(ϕ)P(X=1)=ϕϕ / ϕ(1−ϕ)单次 eval case 通过与否;mle_bernoulli 的估计对象
Categorical(π)P(X=i)=πi,∑iπi=1π / —Softmax 输出层:下一 token 的完整分布
Normal(μ,σ2)f(x)=12πσe−(x−μ)22σ2μ / σ2量化噪声、扩散过程扰动的标准模型
  • Jensen 不等式:g 为凸函数时 E[g(X)]≥g(E[X])。它是 RL 方差缩减的理论支点——第11章 Rao–Blackwell 论证"条件期望不增方差"用的正是它(策略梯度定理小节)。
  • 中心极限定理(CLT)一句话:独立同分布样本均值 X¯ 随 n 增大趋向正态 N(μ,σ/n)——"小批量梯度(逐样本梯度的批均值)近似高斯"这一假设的出处,也是第7章把梯度分布当体检对象(训练诊断)的统计前提。

(本小节恒等式与分布表源自 Stanford CS229 VIP cheatsheet 的概率统计 refresher, Amidi & Amidi, 2018;因果推断框架参考 Shalizi Advanced Data Analysis from an Elementary Point of View, 2021;本课按 LLM 场景重新选取与锚定。)

7. 因果推断初步:关联 P(Y∣X) 与干预 P(Y∣do(X)) ​

传统语言模型本质上是关联机器:它从海量文本中学习联合分布与条件分布 P(Y∣X)(即“在看到提示词 X 的条件下,词元 Y 出现的条件概率”)。

然而,当我们要深入大模型内部进行可解释性分析或精准知识修改时,仅观察条件概率就会陷入“相关性不等于因果性”的困境:某个神经元在输出正确答案时高度激活,它究竟是产生答案的因果中介(Causal Mediator),还是仅仅被其他共享特征捎带激活的混杂副产物(Confounder)?

为严谨回答这一问题,现代大模型机理研究引入了 Judea Pearl 的因果图与 do 算子(Intervention):

  • 观测条件概率 P(Y∣X=x):在系统被动运行时,仅仅筛选出输入恰好为 x 的子样本,观察输出 Y 的分布;
  • 物理干预概率 P(Y∣do(X=x)):人为切断输入节点 X 与其所有上游因果父节点的联系,强行将 X 设为定值 x,观察这种主动干预对下游输出 Y 产生的净影响。

IMPORTANT

第 11 章 ROME 知识编辑的因果推断地基

在 第11章 · 知识编辑 中,Meng 等人提出的 ROME 算法正是利用因果干预 do(hi(l)=clean),通过对主体词元注入高斯噪声打断事实流动,再局部恢复特定中间层的隐藏激活,计算间接因果效应(Indirect Effect),从而在数学上严格证明了“事实记忆精准储存在中间层 FFN 权重中”!


阶段五:优化算法与神经网络原型 ​

1. 损失曲面地形与梯度下降 ​

θ←θ−η⋅∇L(θ)

沿着梯度的反方向迈步下山。引入**动量(Momentum)**给更新增加物理惯性:v←βv−η∇L,θ←θ+v,平滑冲破局部小坑与狭长峡谷震荡:

等高线图上的两条优化路径:梯度下降沿最陡方向锯齿下行,动量带惯性平滑滚过小坑直达山谷

2. 全书最核心的代码骨架:5 行神经网络训练循环 ​

全书所有模型训练最终都浓缩在这 5 行核心循环中:

python
for epoch in epochs:
    logits = model(x)           # ① 前向传播:计算模型预测
    loss = criterion(logits, y) # ② 计算损失:衡量预测与标签的差距(交叉熵)
    loss.backward()             # ③ 反向传播:链式法则自动计算各参数梯度
    optimizer.step()            # ④ 参数更新:沿梯度反方向更新权重
    optimizer.zero_grad()       # ⑤ 梯度清零:防止下一批次梯度错误累加

阶段六:故障排查 / 典型数学报错 ​

在大模型数学计算与算法实现中,以下是最容易踩中的高频数学陷阱:

故障注入场景预期报错或异常信号正确修复与防护方案
中心差商步长 h 取太小(如 10−16)计算误差大幅发散(>1.0),全是浮点舍入噪声取机器精度平方根级别步长 h≈10−5,误差回到 10−4 以内
偏导数求导时未冻结其他自变量对 x 求导结果受 y 变化串扰严重漂移求 ∂f∂x 时严格固定 y 为常数,只让 x 施加微扰
矩阵乘法行列索引顺序颠倒输出矩阵尺寸颠倒或变成转置矩阵牢记矩阵乘契约:out[i][j] = row_i · col_j
贝叶斯后验概率颠倒先验与似然计算所得概率值 >1.0(违背概率公理)严格遵循贝叶斯定理:P(A|B)=P(B|A)P(A)P(B)
Softmax 计算未减去最大值输入较大 logits 时产生 RuntimeWarning: overflow 或 nan利用平移不变性,计算前先减去张量最大值:z - max(z)
交叉熵或 KL 散度直接计算 log⁡(0)抛出 ValueError: math domain error 或生成 -inf严密添加极小防零偏移:np.log(p + 1e-12) 或过滤零项
梯度下降参数更新符号误写为 +=损失函数 Loss 不降反升,数值指数发散炸裂梯度指向最陡上升方向,下降更新必须为减号:θ←θ−η⋅∇θL
动量速度向量 v 未正确初始化首轮更新结果不可复现或产生奇异步长将动量张量 v 严格初始化为全零,与 PyTorch SGD(momentum) 对齐

阶段七:动手实验与自查验收 ​

实验与测试 ​

Google Pro 云端实验

第 3 章 · 大模型核心数学桥接实验场

⚡推荐规格:Google Pro A100 / L4 GPU (或 CPU)

零算力门槛,本地 CPU 或 Google Colab 免费运行时秒级跑通

💡 运行提示:若本仓库为 GitHub 私有仓库,首次在 Colab 打开时请在弹出的对话框中点击「Authorize with GitHub」授权读取;或直接点击「⬇️ 下载 .ipynb」并在 Colab 中选择「上传笔记本」运行。
bash
cd <仓库根目录>
source .venv/bin/activate
export PYTHONPATH="$PWD/python"

# 运行本章数学核心算法与差商对拍测试
python -m pytest python/tests/test_w0p_python_math.py -k "derivative or chain_rule or bayes or entropy or cross_entropy or softmax" -q

上面的公式在练习文件 python/labs/w0p_exercises.py 里有同名函数:dot_product、chain_rule_2layer、gradient_vector、categorical_sample、mle_bernoulli、entropy、cross_entropy、kl_divergence、gradient_descent_step、momentum_update。后文写「第3章的 mle_bernoulli」这类名字时,指的就是这份练习和本节公式。Softmax 的代码样本在本节,函数名是 stable_softmax;练习文件里没有名为 softmax 的函数。

核心能力自查清单 ​

完成本章后,请对照下表确认心智模型是否建立完毕:


论文与延伸 ​

本章侧重为全书打通数学直觉与符号契约,所涉基础微积分与概率论延伸参考:


资源 / 成本 / 隐私 ​

本地 Python/NumPy、CPU 即可完成全部数学计算;gross cost 为 0。只用合成数值,不涉及外部数据、账号或隐私信息。


Evidence ​

仓库当前机器证据(只读快照) ​

本章机器证据:evidence/02-runtime-v1.json。证明数学基础与差商对拍全绿。本文件已登记进 evidence/module-manifest-v1.json。

学习者提交模板(待填写,不是当前机器证据) ​

复制下面模板并填写自己的真实运行结果。所有 <...> 都是未填写状态;actual 和 artifacts 尤其不能被当作已运行或已通过。

yaml
schema: learn-llm.evidence.v1
module: 03-math-bridge
commit: <learner-commit-sha>
verified_at: <iso-date>
environment: <sanitized-python-device>
seed: 0
commands:
  - PYTHONPATH=python python -m pytest python/tests/test_w0p_python_math.py -q
metrics:
  - name: exercises_tests_passed
    expected: 36
    actual: <recorded-value>
  - name: exercises_tests_skipped
    expected: 0
    actual: <recorded-value>
  - name: difference_quotient_abs_error_cubic_at_2
    expected: <1e-4
    actual: <recorded-value>
artifacts:
  - <learner-repo-relative-artifact-path>
cost:
  gross_usd: 0
  credit_usd: 0
licenses:
  - source: <source>
    version: <version>
    license: <license>
    attribution: <attribution>
    redistribution: <redistribution>
known_failures:
  - <sanitized-failure-or-none>

下一步 ​

进入 第4章 · 自动微分与计算图: 你将把本章学到的类运算符重载、闭包与多元链式法则融会贯通,亲手从零写出微型自动微分引擎 Value,实现全自动反向传播!

私有学习站 · 原理从零构建 · 勿提交个人隐私或密钥