AI大模型底层原理图解指南
无需高深数学背景,带你像玩积木一样拆解 AI 大模型!从「高维空间与线性代数宏观图谱」,到「怎么用一串数字向电脑描述一只猫」,再到神经网络、注意力机制,直到撑起 ChatGPT 的 Transformer、混合专家与模型蒸馏,再到推理模型、多模态与智能体。全套 42 堂硬核又好懂的科普漫游课 + 6 篇原典探索、大厂发展史与综合大考,配齐交互动画与生动图解,即开即学。
开始探索第 00 课:从零认识线性代数 →什么是线性代数
从空间、对象与动作出发,建立 AI 数学的全局地图。
什么是向量
用一组有顺序的数字,给事物拍一张可以计算的数字照片。
向量的常见运算
距离、点积、数乘与加权和:比较方向,也组合信息。
什么是矩阵
从奶茶配方表出发,看一张矩阵如何同时计算多组加权求和。
矩阵的常见运算
一天的成本会算了,一周呢?从批量算账走进矩阵乘法、转置与运算顺序。
什么是线性变换
给矩阵换一副几何眼镜,看整个空间如何旋转、拉伸、投影与平移。
什么是张量:数据的形状
一个词、一句话、一批句子:数据越装越多,怎样读懂它的每一个轴?
什么是函数:从输入到输出
把数字送进规则机器:读懂曲线、函数复合,以及指数与对数的来回转换。
什么是梯度
从函数曲线的坡度,到多维空间里指向上升最快方向的梯度。
概率与统计
给不确定性画张地图:条件概率、采样、期望,以及平均数看不见的波动。
信息量、熵与交叉熵
有了概率地图,怎样量出意外、不确定性,以及模型猜错的代价?
神经元结构
一个加权投票器,加上偏置与激活,就成为神经网络的基本单元。
激活函数
线性叠线性仍然是线性,非线性怎样给深层网络真正的表达力?
神经网络、前向传播与训练
从一个神经元到整层矩阵,沿数据流看清前向传播,再认识完整训练循环。
Softmax:从得分到概率
先读懂原始得分,再把它变成概率分布;温度改变集中程度,不保证答案正确。
损失函数:衡量预测的代价
从预测概率到损失分数,区分 MSE、交叉熵、准确率与不同求导对象。
反向传播:梯度如何传回来
沿计算图应用链式法则,高效算出梯度;更新参数则留给优化器。
梯度下降与优化器
用已经算出的梯度更新参数:学习率、Mini-batch、动量、Adam 与 AdamW。
参数初始化与训练稳定性
打破神经元的对称性,控制激活与梯度的尺度,让网络有机会学得动。
过拟合、泛化与正则化
训练题做对不等于真正学会:用独立数据检验,用早停与正则化改善泛化。
注意力机制
不再只挤进一个记忆瓶口:让每个词回头看,按相关程度提取信息。
多头注意力
在多组子空间中并行观察,组合不同角度的上下文信息。
Transformer 架构
把注意力、前馈网络与稳定通路,组装成完整的 Transformer。
Tokenizer 分词器
文本如何被切成 token,再变成模型能接收的数字?
编码器、解码器与大语言模型
同样的积木,不同的排列:理解 BERT、GPT 与编码器解码器。
残差连接与层归一化
用残差通路传递信号,用归一化控制尺度,让深层网络更容易训练。
预训练 · 监督微调 · 强化学习
从预测下一个词,到模仿示范与学习偏好,模型怎样成为助手?
KV 缓存、稀疏注意力与 FlashAttention
减少重复计算和数据搬运,给注意力与生成过程提速。
MoE 混合专家架构
每次只调用部分专家,让总容量与单次计算量不再同步增长。
模型蒸馏
把大模型的输出分布当作教材,让小模型学习其中的知识。
串讲:从 N-gram 到 Transformer
把表示、计算、概率与学习串起来,重走语言模型的演进道路。
推理模型:让模型「先想再答」
从思维链与可验证奖励,理解模型为什么能花更多计算去推理。
注意力瘦身术与长上下文
从 GQA、MLA 到线性注意力,理解长上下文的计算与显存账。
推理提速:量化与投机解码
用更少的位数存权重,让小模型打草稿、大模型验收。
多模态大模型:看图、听声、画画
把视觉和声音变成模型可以处理的表示,连接不同模态。
智能体:从会说话到会做事
模型、工具与循环,怎样组成一个能执行任务的系统?
前沿与未来:下一程
从新的表示与推理路径出发,看看前沿还在解决哪些问题。