零门槛 · AI 大模型原理探索

AI大模型底层原理图解指南

无需高深数学背景,带你像玩积木一样拆解 AI 大模型!从「高维空间与线性代数宏观图谱」,到「怎么用一串数字向电脑描述一只猫」,再到神经网络、注意力机制,直到撑起 ChatGPT 的 Transformer、混合专家与模型蒸馏,再到推理模型、多模态与智能体。全套 42 堂硬核又好懂的科普漫游课 + 6 篇原典探索、大厂发展史与综合大考,配齐交互动画与生动图解,即开即学。

开始探索第 00 课:从零认识线性代数 →
IV

大语言模型

彻底引爆 AI 革命:从注意力到 ChatGPT
卷IV 导读与全景 →
25

注意力机制

不再只挤进一个记忆瓶口:让每个词回头看,按相关程度提取信息。

→
26

多头注意力

在多组子空间中并行观察,组合不同角度的上下文信息。

→
27

Transformer 架构

把注意力、前馈网络与稳定通路,组装成完整的 Transformer。

→
28

Tokenizer 分词器

文本如何被切成 token,再变成模型能接收的数字?

→
29

编码器、解码器与大语言模型

同样的积木,不同的排列:理解 BERT、GPT 与编码器解码器。

→
30

残差连接与层归一化

用残差通路传递信号,用归一化控制尺度,让深层网络更容易训练。

→
31

预训练 · 监督微调 · 强化学习

从预测下一个词,到模仿示范与学习偏好,模型怎样成为助手?

→
32

KV 缓存、稀疏注意力与 FlashAttention

减少重复计算和数据搬运,给注意力与生成过程提速。

→
33

MoE 混合专家架构

每次只调用部分专家,让总容量与单次计算量不再同步增长。

→
34

模型蒸馏

把大模型的输出分布当作教材,让小模型学习其中的知识。

→
35

串讲:从 N-gram 到 Transformer

把表示、计算、概率与学习串起来,重走语言模型的演进道路。

→
36

推理模型:让模型「先想再答」

从思维链与可验证奖励,理解模型为什么能花更多计算去推理。

→
37

注意力瘦身术与长上下文

从 GQA、MLA 到线性注意力,理解长上下文的计算与显存账。

→
38

推理提速:量化与投机解码

用更少的位数存权重,让小模型打草稿、大模型验收。

→
39

多模态大模型:看图、听声、画画

把视觉和声音变成模型可以处理的表示,连接不同模态。

→
40

智能体:从会说话到会做事

模型、工具与循环,怎样组成一个能执行任务的系统?

→
41

前沿与未来:下一程

从新的表示与推理路径出发,看看前沿还在解决哪些问题。

→