一、会议背景与目的
为什么会有这堂课、面向谁、想达成什么。
- 背景:
正值"中美大模型大战"关键期,国家在算力、人才上投入巨大。主办方(中国计算机学会 CCF、中国人民大学高瓴人工智能学院,以及清华、北大、南大等)希望把大模型底层知识提前普及到中学生,打破"本科→研究生→博士"的传统人才培养路径。 - 主讲人简介:
陈子恒,吉林大学唐敖庆班(计算机理科实验班)专业排名第一,GPA 3.94,保送人大高瓴;CSP 认证 380 分;国家奖学金、全国大学生数学竞赛省一等奖、蓝桥杯国赛奖;研究方向为多模态大模型与多模态交互(模型能同时理解文字、语音、视频)。 - 课程定位:
第一轮认证全部是选择题,考的是基础逻辑思维与核心概念理解,不考高深算法、不要求写长代码。把知识点"掰碎揉碎"讲明白,认证"大家踮踮脚就能够到"。
核心结论:LMCC 第一轮认证没有想象中难。理解 Self-Attention、MoE 等核心概念,不用背复杂公式或写代码,就能拿下大部分题目。
二、两个当红国产大模型(开眼界)
通过真实模型感受"参数为什么这么大""为什么都要用 MoE"。
① Kimi K3(月之暗面,7 月 17 日发布)
- 规模:
2.8 万亿(2.8T)参数,全球最大开源模型;发布 30 分钟即登顶 Hugging Face 趋势榜,创平台最快增长纪录。 - 存储与部署(主讲人测算):
2.8 万亿参数 × 2 字节 ≈ 5.6 万亿字节 ≈ 5600 GB;放满模型需约 88 张华为昇腾 910B(64GB/张),跑起来约需 100 张;按每张卡约 11 万计,仅部署运行就要上千万级显卡投入。 - 战绩:
Program Bench、SW Marathon(软件公司马拉松)均排名第一;Agent 领域拿了两个第一,多项指标压过 Claude Opus、GPT、Gemini 等闭源模型。 - 两大关键技术:
Stable-Late MoE —— 896 个专家,每次只激活 16 个(激活率约 1.8%);KDA —— 自研注意力机制,专攻长文本处理效率。 - 开源的意义:
不用每次推理都给闭源公司交 API 钱,可一次性买断、本地部署——这也是 DeepSeek 曾让英伟达股价下跌的原因(把推理成本打下来了)。
② DeepSeek V4 Pro(4 月发预览版,8 月中旬正式版)
- 规模:
1.6 万亿参数,完全开源,同样击败 Claude Opus / GPT / Gemini。 - 主打"效率":
单 token 所需 FLOPs(浮点运算次数)较上一代大幅下降;累积 KV Cache(显存占用)降幅达十几倍 → 推得更快、显存更少、API 更便宜。 - 两大关键技术:
CSA + HCA —— 自研注意力,为百万级 Token 优化;MoE —— 384 个专家只激活 6 个,计算成本约为全量模型的 3%。
图 1:Kimi K3 与 DeepSeek V4 Pro 的共同技术主线
三、自注意力机制 Self-Attention(考纲基石)
所有大模型的底层。核心一句话:模型靠 Q、K、V 三个向量,算"谁和谁相关",再用相关性去加权汇总信息。
从一句话讲起:"我爱小狗"
- 词表与序号:
模型有一个词表(如 1 万个词)。"我爱小狗"被拆成 4 个 token,每个 token 是词表里的序号,如 x₁=1、x₂=100、x₃=1000、x₄=10000。 - One-Hot → Embedding:
序号先变成 one-hot 向量(仅对应位置为 1),再经 Embedding 映射成 512 维(或更高)的浮点向量,进入"潜在空间(Latent Space)",获得语义信息。 - 三个线性变换:
每个 token 分别乘以矩阵 Wq、Wk、Wv,得到 Q(Query 询问)、K(Key 关键)、V(Value 值)三个向量。Q/K/V 不是查表来的,是矩阵运算得到的——这三个矩阵就是模型要存的核心参数(模型自己训出来的)。 - 算相关性:
Q 与各个 K 做点积(512 维×512 维再相加),数值越大代表越接近、越相关。 - Softmax 归一化:
点积结果不一定在 0~1 之间,用 softmax(指数变换后除以四项之和)把它压到 0~1,得到"注意力权重"。除以 √dk是为了防止维度大时点积过大、便于 softmax 计算。 - 加权求和得输出:
用这些权重对 V 做加权平均,得到每个 token 的输出 B。
公式(必须懂):Attention(Q,K,V) = softmax(QKᵀ / √dk) · V。考试不考公式推导,但考"Q 和 K 算分数、对 V 加权"这个逻辑。
图 2:Self-Attention 计算流程(以"我爱小狗"为例)
Encoder(编码器)vs Decoder(解码器 / 因果注意力)
- Decoder 架构(因果注意力 Causal Attention):
第 i 个 token 只能看"自己及之前"的 token。例如 q₃ 只能看 k₁、k₂、k₃。生成式模型(写一句话、逐 token 生成)就是这种——由前文推下一个 token。这是考纲关键。 - Encoder 架构(编码器):
第 i 个 token 能看"之后"的 token。例如 q₁ 能看 k₂、k₃、k₄。能利用双向上下文。
图 3:Decoder(因果)与 Encoder 的注意力可见范围对比
四、多头自注意力 Multi-Head Attention
把 512 维拆成若干组(如 256+256)。第一组 Q/K/V 只在第一组内部交互,第二组只在第二组内部交互。 - 动机:
假设不同维度承载不同语义——比如一组关注"颜色"、一组关注"轮廓",各自独立提取特征。 - 做法:
每组各自跑一遍 Self-Attention 得到一组输出向量,再把各组输出拼接,即为最终结果。本质就是把信息投影到不同子空间分别处理。
单头 Self-Attention 就是"只留一组"的特例。多头只是"算多次、再拼接",计算过程与单头一致。
五、真题演练 ①:Attention 中 Q、K、V 的作用
题目:关于注意力机制中 Query、Key、Value 的作用,下列说法正确的是?
softmax(QKᵀ/√dk)·V 的逻辑。 | ||
做题心法:第一轮认证不考复杂公式,只要把"Q 和 K 算分数、对 V 加权"这个核心过程理解清楚,就能选出 B。
六、MoE 混合专家架构(考纲重点)
为什么大模型都"上 T"却还能跑得动?答案就是 MoE:把巨大网络拆成很多"专家",每次只叫最合适的一小撮干活。
Dense(稠密)模型 vs MoE(混合专家)
- Dense:
只有一个巨大的前馈网络 FFN,每次计算动用所有参数。想变聪明就得加参数,但计算量、成本随之暴增。 - MoE:
把大 FFN 拆成多个小 FFN(即"专家"),每次只选 Top-k 个专家参与计算,再对它们的输出加权求和。参数量巨大但激活参数量小,推理成本大幅下降,符合 Scaling Law(参数越大能力越强)。
Router(路由)怎么选专家
有一个路由矩阵 W(含多个向量),与输入 token 做点积,得到一组"匹配分数"(越大 = 该 token 越适合这个专家)。 经 Softmax 变成 0~1 权重,用权重对各个专家(FFNᵢ)的输出做加权求和,得到 MoE 层最终输出。
图 4:MoE 路由与专家选择示意
MoE 的两大挑战
- 路由坍塌(负载不均衡):
某专家一旦被激活,参数就被更新、变得更"适应该任务",于是 Router 下次更倾向分给它 → 少数专家被过度使用,多数专家收不到 token、训练不足。解法:负载均衡损失(Load Balancing Loss)强制各专家接收更均匀的 token。 - 通信成本高:
专家分散在多张 GPU 上,token 算出来需要的专家若在另一张卡,就要跨卡传输再返回,通信开销大。学术界仍在攻关。
MoE 为什么重要(对比表)
七、真题演练 ②:MoE 混合专家的挑战
逻辑推理也能得分:B 说"稀疏模型比稠密模型慢"——都已经稀疏了,怎么可能更慢?方向上就能排除。
八、训练 vs 推理(怎么区分)
一句话:训练是"已知整句话、一次算所有损失来纠错";推理是"只有一个词、反复过模型、一个一个往外蹦"。
图 5:训练(一次算全句损失)vs 推理(逐 token 生成)
九、Token、Embedding 与 Tokenizer
- 为什么叫 token 不叫 word:
计算机只能处理数字。人理解的"我爱小猫"要转成计算机好懂的高维向量(如 512/2048 维浮点数)。相似词(猫/狗)的 embedding 在向量空间里靠得近。 - 输入层(文字→矩阵):
句子 → Tokenizer 切成序号(如 1,100,1000,10000,代表词表中的位置)→ 查 Embedding 表 → 得到 4 个 token 向量。 - 输出层(矩阵→文字):
token 经模型更新得到新向量 Y → 再查同一张 Embedding 表 → 反推它在词表中是第几位 → 对应出汉字。输入和输出的 Embedding 通常共用一套参数。 - 各家词表统一吗?
不统一。DeepSeek、Kimi、OpenAI 各有各的词表;多模态模型还有视觉 token、语音 token,处理方式也不同(不再依赖传统声卡采集)。
Q:V、K 向量是查表得到的吗?A:不是。Q/K/V 都不是查表来的,而是 token 的 embedding 分别乘以矩阵 Wq/Wk/Wv(线性变换)算出来的;这三个矩阵就是要存的大模型参数,由模型自己训练得到。
十、Q&A 精华 & 考试技巧
Q:训练一个大模型要多少钱?A:基本都要上亿人民币。以 DeepSeek V4 Pro 为例,约需 800 万 GPU-hours,按每 GPU-hour 1~3 美元折算约 5800 万~1.7 亿人民币;更贵的是人力(请专家)。数据是公司护城河,绝不开源,只开源权重。
Q:大模型的"温度(temperature)"和 QKV 有关系吗?A:没有特别大的关系。温度是采样策略层面的事,不影响 Q/K/V 的计算逻辑。
Q:选择题有什么技巧?A:第一轮认证的选项本身蕴含信息,靠"读选项 + 逻辑推理"就能做。比如绝对化表述("无法处理""极其不稳定")常是错误项;方向反了的("稀疏比稠密慢")也能直接排除。
推荐学习资源:B 站「3Blue1Brown」《线性代数本质》——只看"矩阵乘法 / 向量运算"那几集即可,不必深究,够用。
十一、考纲速记卡
softmax(QKᵀ/√dk)·V | ||
本总结依据线上讲座逐字稿整理,保留核心知识点与真题解析,并配手绘示意图辅助理解。讲座回放将发布于 LMCC 认证官网;次日 15:00 同一直播间继续讲解考纲大纲。
