1.《第一轮认证真题选讲与大纲知识点串讲1》

四季读书网 2 0
1.《第一轮认证真题选讲与大纲知识点串讲1》
本文由WorkBuddy根据逐字稿生成,直播于8月8日15点。不构成学习建议,深度学习请去看回放链接:https://lmcc.ccf.org.cn/101/1010/10297.html
文末增加交流群,专门交流LMCC青少组,欢迎想要了解学习的朋友们。

一、会议背景与目的

为什么会有这堂课、面向谁、想达成什么。

  • 背景:
    正值"中美大模型大战"关键期,国家在算力、人才上投入巨大。主办方(中国计算机学会 CCF、中国人民大学高瓴人工智能学院,以及清华、北大、南大等)希望把大模型底层知识提前普及到中学生,打破"本科→研究生→博士"的传统人才培养路径。
  • 主讲人简介:
    陈子恒,吉林大学唐敖庆班(计算机理科实验班)专业排名第一,GPA 3.94,保送人大高瓴;CSP 认证 380 分;国家奖学金、全国大学生数学竞赛省一等奖、蓝桥杯国赛奖;研究方向为多模态大模型与多模态交互(模型能同时理解文字、语音、视频)。
  • 课程定位:
    第一轮认证全部是选择题,考的是基础逻辑思维与核心概念理解,不考高深算法、不要求写长代码。把知识点"掰碎揉碎"讲明白,认证"大家踮踮脚就能够到"。

核心结论:LMCC 第一轮认证没有想象中难。理解 Self-Attention、MoE 等核心概念,不用背复杂公式或写代码,就能拿下大部分题目。

二、两个当红国产大模型(开眼界)

通过真实模型感受"参数为什么这么大""为什么都要用 MoE"。

① Kimi K3(月之暗面,7 月 17 日发布)

  • 规模:
    2.8 万亿(2.8T)参数,全球最大开源模型;发布 30 分钟即登顶 Hugging Face 趋势榜,创平台最快增长纪录。
  • 存储与部署(主讲人测算):
    2.8 万亿参数 × 2 字节 ≈ 5.6 万亿字节 ≈ 5600 GB;放满模型需约 88 张华为昇腾 910B(64GB/张),跑起来约需 100 张;按每张卡约 11 万计,仅部署运行就要上千万级显卡投入。
  • 战绩:
    Program Bench、SW Marathon(软件公司马拉松)均排名第一;Agent 领域拿了两个第一,多项指标压过 Claude Opus、GPT、Gemini 等闭源模型。
  • 两大关键技术:
    Stable-Late MoE —— 896 个专家,每次只激活 16 个(激活率约 1.8%);KDA —— 自研注意力机制,专攻长文本处理效率。
  • 开源的意义:
    不用每次推理都给闭源公司交 API 钱,可一次性买断、本地部署——这也是 DeepSeek 曾让英伟达股价下跌的原因(把推理成本打下来了)。

② DeepSeek V4 Pro(4 月发预览版,8 月中旬正式版)

  • 规模:
    1.6 万亿参数,完全开源,同样击败 Claude Opus / GPT / Gemini。
  • 主打"效率":
    单 token 所需 FLOPs(浮点运算次数)较上一代大幅下降;累积 KV Cache(显存占用)降幅达十几倍 → 推得更快、显存更少、API 更便宜。
  • 两大关键技术:
    CSA + HCA —— 自研注意力,为百万级 Token 优化;MoE —— 384 个专家只激活 6 个,计算成本约为全量模型的 3%。

两个模型的共同主线 = 自研 Attention + MoE(均为考纲重点)Kimi K32.8T 参数 · 全球最大开源专家 896 · 激活 16(1.8%)自研注意力 KDA(长文本)DeepSeek V4 Pro1.6T 参数 · 完全开源专家 384 · 激活 6(1.66%)自研注意力 CSA+HCA(百万Token)不同公司、不同模型 → 殊途同归:自研 Attention + MoE

图 1:Kimi K3 与 DeepSeek V4 Pro 的共同技术主线

三、自注意力机制 Self-Attention(考纲基石)

所有大模型的底层。核心一句话:模型靠 Q、K、V 三个向量,算"谁和谁相关",再用相关性去加权汇总信息。

从一句话讲起:"我爱小狗"

  1. 词表与序号:
    模型有一个词表(如 1 万个词)。"我爱小狗"被拆成 4 个 token,每个 token 是词表里的序号,如 x₁=1、x₂=100、x₃=1000、x₄=10000。
  2. One-Hot → Embedding:
    序号先变成 one-hot 向量(仅对应位置为 1),再经 Embedding 映射成 512 维(或更高)的浮点向量,进入"潜在空间(Latent Space)",获得语义信息。
  3. 三个线性变换:
    每个 token 分别乘以矩阵 WqWkWv,得到 Q(Query 询问)K(Key 关键)V(Value 值)三个向量。Q/K/V 不是查表来的,是矩阵运算得到的——这三个矩阵就是模型要存的核心参数(模型自己训出来的)。
  4. 算相关性:
    Q 与各个 K 做点积(512 维×512 维再相加),数值越大代表越接近、越相关。
  5. Softmax 归一化:
    点积结果不一定在 0~1 之间,用 softmax(指数变换后除以四项之和)把它压到 0~1,得到"注意力权重"。除以 √dk 是为了防止维度大时点积过大、便于 softmax 计算。
  6. 加权求和得输出:
    用这些权重对 V 做加权平均,得到每个 token 的输出 B。

公式(必须懂):Attention(Q,K,V) = softmax(QKᵀ / √dk) · V。考试不考公式推导,但考"Q 和 K 算分数、对 V 加权"这个逻辑。

我爱小狗x₁..x₄ 序号Embedding512维向量Wq→QWk→KWv→VQ·Kᵀ相关性分数÷√dk 缩放Softmax权重 × V加权求和B输入 → 词表序号 → Embedding(512维) → 线性变换得 Q/K/V → 算相关性 → 归一化 → 对 V 加权 → 输出

图 2:Self-Attention 计算流程(以"我爱小狗"为例)

Encoder(编码器)vs Decoder(解码器 / 因果注意力)

  • Decoder 架构(因果注意力 Causal Attention):
    第 i 个 token 只能看"自己及之前"的 token。例如 q₃ 只能看 k₁、k₂、k₃。生成式模型(写一句话、逐 token 生成)就是这种——由前文推下一个 token。这是考纲关键。
  • Encoder 架构(编码器):
    第 i 个 token 能看"之后"的 token。例如 q₁ 能看 k₂、k₃、k₄。能利用双向上下文。

Decoder(因果注意力)只能看左边Encoder 能看左右两边x₁x₂x₃x₄↑x₁只看自己x₃只看 x₁x₂x₃x₁x₂x₃x₂ 能看 x₁..x₃ 双向生成式大模型多用 Decoder;Encoder 利用完整上下文

图 3:Decoder(因果)与 Encoder 的注意力可见范围对比

四、多头自注意力 Multi-Head Attention

  • 把 512 维拆成若干组(如 256+256)。第一组 Q/K/V 只在第一组内部交互,第二组只在第二组内部交互。
  • 动机:
    假设不同维度承载不同语义——比如一组关注"颜色"、一组关注"轮廓",各自独立提取特征。
  • 做法:
    每组各自跑一遍 Self-Attention 得到一组输出向量,再把各组输出拼接,即为最终结果。本质就是把信息投影到不同子空间分别处理。

单头 Self-Attention 就是"只留一组"的特例。多头只是"算多次、再拼接",计算过程与单头一致。

五、真题演练 ①:Attention 中 Q、K、V 的作用

题目:关于注意力机制中 Query、Key、Value 的作用,下列说法正确的是?

选项
判断
解析
A. Query 用于存储待检索的信息,Key 用于生成最终输出
✗ 错
Key 是与 Query 相乘算权重的"关键",并非最终输出;最终输出是权重与 Value 的加权求和。
B. 注意力分数通过 Query 与 Key 的点积计算得到,再经 Softmax 后对 Value 加权求和
✓ 对
完全符合 softmax(QKᵀ/√dk)·V 的逻辑。
C. Softmax 函数的作用是将注意力分数映射到负无穷到正无穷
✗ 错
Softmax 输出是 0~1 之间的概率权重(各项之和=1),不是负无穷到正无穷。
D. Value 向量决定了哪些位置应获得更高注意力权重
✗ 错
决定"谁更重要"的是 Q 与 K 的点积,Value 只是被加权的"信息载体"。

做题心法:第一轮认证不考复杂公式,只要把"Q 和 K 算分数、对 V 加权"这个核心过程理解清楚,就能选出 B。

六、MoE 混合专家架构(考纲重点)

为什么大模型都"上 T"却还能跑得动?答案就是 MoE:把巨大网络拆成很多"专家",每次只叫最合适的一小撮干活。

Dense(稠密)模型 vs MoE(混合专家)

  • Dense:
    只有一个巨大的前馈网络 FFN,每次计算动用所有参数。想变聪明就得加参数,但计算量、成本随之暴增。
  • MoE:
    把大 FFN 拆成多个小 FFN(即"专家"),每次只选 Top-k 个专家参与计算,再对它们的输出加权求和。参数量巨大但激活参数量小,推理成本大幅下降,符合 Scaling Law(参数越大能力越强)。

Router(路由)怎么选专家

  • 有一个路由矩阵 W(含多个向量),与输入 token 做点积,得到一组"匹配分数"(越大 = 该 token 越适合这个专家)。
  • 经 Softmax 变成 0~1 权重,用权重对各个专家(FFNᵢ)的输出做加权求和,得到 MoE 层最终输出。

MoE:一个 token 进来,Router 只派最合适的几个专家TokenRouter算匹配分专家FFN₁专家FFN₂专家FFN₃专家FFN₄加权求和Top-k 专家输出只激活 Top-k(如 1~2 个),其余专家"休息" → 激活参数小、成本低

图 4:MoE 路由与专家选择示意

MoE 的两大挑战

  • 路由坍塌(负载不均衡):
    某专家一旦被激活,参数就被更新、变得更"适应该任务",于是 Router 下次更倾向分给它 → 少数专家被过度使用,多数专家收不到 token、训练不足。解法:负载均衡损失(Load Balancing Loss)强制各专家接收更均匀的 token。
  • 通信成本高:
    专家分散在多张 GPU 上,token 算出来需要的专家若在另一张卡,就要跨卡传输再返回,通信开销大。学术界仍在攻关。

MoE 为什么重要(对比表)

维度
Dense 稠密模型
MoE 混合专家
每次计算
动用全部参数
只激活 Top-k 个专家
想变聪明
加参数 → 计算量暴增、成本暴增
加更多专家,每次仍只派少数人 → 成本几乎不变
现实例子
Kimi K3:896 专家 / 激活 16(1.8%);DeepSeek V4:384 专家 / 激活 6(1.66%)

七、真题演练 ②:MoE 混合专家的挑战

选项
判断
解析
A. 模型训练过程极其不稳定,难以收敛
✗ 错
现代 MoE 都加了负载均衡损失来稳定训练,不再"难以收敛"。
B. 训练和推理速度相比同等参数的稠密模型会更慢
✗ 错
同等参数下,MoE 每次只激活一小部分参数,计算步更少,反而更快
C. 专家负载不均衡,可能导致某些专家被过度使用、其他专家训练不足
✓ 对
正是"路由坍塌"问题。
D. 模型无法处理长序列,存在上下文长度限制
✗ 错
长序列限制来自 Self-Attention(输入端),与 Dense/MoE 的差别无关。

逻辑推理也能得分:B 说"稀疏模型比稠密模型慢"——都已经稀疏了,怎么可能更慢?方向上就能排除。

八、训练 vs 推理(怎么区分)

一句话:训练是"已知整句话、一次算所有损失来纠错";推理是"只有一个词、反复过模型、一个一个往外蹦"。

训练 Training推理 Inference4个token一起进模型一次forward算4个loss已知答案→纠正模型每次只出1个token反复过模型生成过程:我→爱→小→狗

图 5:训练(一次算全句损失)vs 推理(逐 token 生成)

九、Token、Embedding 与 Tokenizer

  • 为什么叫 token 不叫 word:
    计算机只能处理数字。人理解的"我爱小猫"要转成计算机好懂的高维向量(如 512/2048 维浮点数)。相似词(猫/狗)的 embedding 在向量空间里靠得近。
  • 输入层(文字→矩阵):
    句子 → Tokenizer 切成序号(如 1,100,1000,10000,代表词表中的位置)→ 查 Embedding 表 → 得到 4 个 token 向量。
  • 输出层(矩阵→文字):
    token 经模型更新得到新向量 Y → 再查同一张 Embedding 表 → 反推它在词表中是第几位 → 对应出汉字。输入和输出的 Embedding 通常共用一套参数。
  • 各家词表统一吗?
    不统一。DeepSeek、Kimi、OpenAI 各有各的词表;多模态模型还有视觉 token、语音 token,处理方式也不同(不再依赖传统声卡采集)。

Q:V、K 向量是查表得到的吗?A:不是。Q/K/V 都不是查表来的,而是 token 的 embedding 分别乘以矩阵 Wq/Wk/Wv(线性变换)算出来的;这三个矩阵就是要存的大模型参数,由模型自己训练得到。

十、Q&A 精华 & 考试技巧

Q:训练一个大模型要多少钱?A:基本都要上亿人民币。以 DeepSeek V4 Pro 为例,约需 800 万 GPU-hours,按每 GPU-hour 1~3 美元折算约 5800 万~1.7 亿人民币;更贵的是人力(请专家)。数据是公司护城河,绝不开源,只开源权重。

Q:大模型的"温度(temperature)"和 QKV 有关系吗?A:没有特别大的关系。温度是采样策略层面的事,不影响 Q/K/V 的计算逻辑。

Q:选择题有什么技巧?A:第一轮认证的选项本身蕴含信息,靠"读选项 + 逻辑推理"就能做。比如绝对化表述("无法处理""极其不稳定")常是错误项;方向反了的("稀疏比稠密慢")也能直接排除。

推荐学习资源:B 站「3Blue1Brown」《线性代数本质》——只看"矩阵乘法 / 向量运算"那几集即可,不必深究,够用。

十一、考纲速记卡

知识点
你必须会的
易错点
Self-Attention
softmax(QKᵀ/√dk)·V
;Q 问、K 关键、V 值;÷√dk 防点积过大
决定权重的是 Q·K,不是 V;Softmax 输出 0~1
Encoder/Decoder
Decoder=因果注意力,只看左边(前序);Encoder 看双向
生成式大模型用 Decoder
Multi-Head
把维度分组、各自算注意力再拼接
与单头计算过程一致,只是多算几次
MoE
大 FFN 拆成多专家,每次只激活 Top-k;Router 按匹配分选专家
挑战是路由坍塌(负载均衡损失解决)与通信成本;MoE 比同等 Dense 更快
训练/推理
训练一次算全句损失;推理逐 token 生成
推理需多次过模型
Tokenizer/Embedding
文字→序号→查表得向量;输入输出共用 Embedding
Q/K/V 是矩阵乘出来的,不是查表

本总结依据线上讲座逐字稿整理,保留核心知识点与真题解析,并配手绘示意图辅助理解。讲座回放将发布于 LMCC 认证官网;次日 15:00 同一直播间继续讲解考纲大纲。

交流群,失效联系:wswrlm
1.《第一轮认证真题选讲与大纲知识点串讲1》-第1张图片-四季读书网

抱歉,评论功能暂时关闭!