AI大模型底层原理图解指南
无需高深数学背景,带你像玩积木一样拆解 AI 大模型!从「高维空间与线性代数宏观图谱」,到「怎么用一串数字向电脑描述一只猫」,再到神经网络、注意力机制,直到撑起 ChatGPT 的 Transformer、混合专家与模型蒸馏。全套 31 堂硬核又好懂的科普漫游课 + 3 篇原典探索与综合大考,配齐交互动画与生动图解,即开即学。
开始探索第 00 课:从零认识线性代数 →什么是线性代数
为什么说线性代数是整个现代 AI 帝国的底层母语?——从空间、维度到空间变换,建立全局认知地图
什么是向量
计算机只认识数字,它怎么知道「猫」和「老虎」比「猫」和「金鱼」更像?——用坐标给万物拍张数字照
向量的常见运算
「心有灵犀」也能算出来?——加法、投影点积,以及为什么 AI 喜欢看向量之间的「眼神夹角」
什么是矩阵
如果一个向量是一条数据,那矩阵就是一整张信息表格——如何批量组织和瞬间转换成千上万个数字?
什么是线性变换
矩阵乘法到底在玩什么空间戏法?——看它如何像揉橡皮泥一样,把整个空间旋转、拉伸与投影
什么是梯度
蒙着双眼站在浓雾笼罩的山坡上,脚底怎么找到滚向山谷最低处的捷径?——带你走进梯度的直觉世界
概率与信息
机器如何量化心中的「不确定感」?——从猜硬币的概率到让人感到意外的「信息熵」与交叉熵损失
神经元结构
一个只会「加权投票」的小开关,凭什么能成为整个人工智能大脑的思考起点?
激活函数
为什么一百层平平无奇的直线叠起来还是直线?——激活函数如何给呆板的机器注入「会拐弯」的灵魂
神经网络与训练
把无数个微小开关织成一张巨网,再让它自己摸索规律——「机器学习」究竟在学什么?
损失函数
机器猜错了不要紧,关键是「错得有多离谱」?——损失函数如何给每一次失误打出精确的分数
Softmax
考试打分有高有低,怎么把任意一串杂乱无章的得分,优雅地变成加起来正好 100% 的胜算概率?
梯度下降与优化器
既然知道了下山的方向,每一步究竟该迈多大?步子太小走不到天黑,步子太大容易摔进山谷
反向传播
考试答砸了,网络里成千上万个微小零件该各自承担多少责任?——高效算账追责的链式法则
语言的概率游戏:N-gram
不懂语法修辞、不懂喜怒哀乐,光靠单纯的「数数查账本」,电脑能不能猜出人类下一句要说什么?
词向量
为什么「国王 − 男人 + 女人 ≈ 女王」?带你看懂文字的深刻含义是如何变成空间里的神奇坐标的
前馈神经网络语言模型
没见过的生僻短语就当场卡壳?看神经网络如何利用相近的语义坐标,轻松化解「数数接龙」的尴尬
RNN 循环神经网络
刚读了后半句就忘了前半句?——给神经网络装上一根环形流动管道,让它拥有绵延不绝的记忆
LSTM 长短期记忆网络
为什么机器读着长文章也容易「忘性大」?——装上遗忘门、输入门与输出门,让重要记忆长久保存
注意力机制
读到「它太累了」时,电脑怎么知道「它」指动物还是汽车?让每个词自己学会四处张望、寻找最该关注的焦点
多头注意力
一句话里既有语法指代、又有情绪色彩,一个头忙不过来?并排派出多组注意力侦察兵,全方位洞察语义!
Transformer 架构
彻底扔掉循环链条!把自注意力、前馈网络和高速残差通道巧妙拼装,造就当今大模型最强大的工业发动机
Tokenizer 分词器
大模型眼里的文字到底长什么样?揭秘为什么它经常数不对“strawberry”里究竟有几个字母 r
编码器、解码器与大语言模型
同样是 Transformer 家族,为什么 BERT 擅长做理解考试,而 GPT 却能一路进化成无所不能的写作高手?
残差连接与层归一化
叠了上百层网络的庞然大物,传信号时怎么做到不衰减、不迷路?——给梯度修一条直达底层的高速公路线
预训练 · 监督微调 · 强化学习
刚出炉的大模型只会胡言乱语接下文,它是如何通过「博览群书、高人指点、奖罚纠偏」三步蜕变成贴心助手的?
KV 缓存、稀疏注意力与 FlashAttention
让大模型一口气读完整本书,计算量真的会爆炸吗?工程师们用来大幅提速、降低显存的省流加速秘籍
MoE 混合专家架构
拥有万亿参数的巨无霸模型,每次回答问题却只调动几位专家脑细胞——解密“混合专家”的高效分工策略
模型蒸馏
怎么把千亿大模型的毕生功力,高效传授给能装进手机的小模型?——软标签里蕴藏的“暗知识”教学法
串讲:从 N-gram 到 Transformer
别被繁杂的技术名词吓退!一文串起从最简单的数数到当今大模型的演进脉络——每一代创新都是为了打破上一代的枷锁
前沿与未来:下一程
ChatGPT 引爆全球之后,未来的大模型还会朝哪个方向进化?下一程前沿探索