8:《大模型架构与LMCC第一轮真题选讲》 《LMCC 第二轮认证上机环境配置与选讲》

四季读书网 3 0
8:《大模型架构与LMCC第一轮真题选讲》 《LMCC 第二轮认证上机环境配置与选讲》
本文由WorkBuddy根据逐字稿生成,直播于8月15日15点。不构成学习建议,深度学习请去看回放链接:https://lmcc.ccf.org.cn/101/1010/10297.html
文末增加交流群,专门交流LMCC青少组,欢迎想要了解学习的朋友们。

讲师名片:徐宝义,西安市铁一中学信息学竞赛教练,陕西省优秀教练员、NOI 优秀教师,累计指导逾150人次获全国青少年信息学奥林匹克竞赛一等奖,学生获 NOI 金牌1枚、银牌14枚、铜牌6枚、1人入选国家集训队、4人获国际初中生信息学竞赛金牌。本讲系统串讲大模型架构(神经网络→Transformer→位置编码→注意力),并给出LMCC 第二轮上机环境配置与真题实战要点

一、开场:从学界大事看"为什么学大模型"

8月11日前后,Anthropic 未公开模型(疑似 Claude Opus 4.5)将黎曼猜想的临界值从 41.6% 提升到 67.2%;此前还用模型找到了雅可比猜想的一个反例。大模型能力已远超一两年前的认知——不仅能解答人类已知问题,还能在已有逻辑上推演、突破未知边界。

对信息学竞赛(NOI)选手而言,学 LMCC / 大模型真正补上的是工程思维:竞赛是"限定时间解题",而真实世界的问题往往没有边界。徐老师引用吴军对工程思维的概括:

💡 工程思维四要点:① 边界内做事(承认理论极限,不徒劳造永动机);② 追求闭环与落地;③ 化繁为简(复杂问题拆模块再重组);④ 系统迭代升级(不幻想一次性成功,遇问题再改)。另含真实问题拆解能力查阅文档/论文能力AI 时代交叉验证的判断力(多平台、多方法验证真伪与幻觉)。

二、大模型发展简史:站在前人肩膀上的迭代

技术不是突然成熟的,而是一步步迭代优化:从统计语言模型,到序列模型,再到"全文注意力"的 Transformer,最后涌现出惊艳能力。

N-gram(统计语言模型)用大量语料统计相邻词概率,常用 3-gram;只看邻近关系,无法关注远距离联系。RNN / LSTM(2013 序列模型)隐藏层记住前文再预测,适合序列;但必须顺序生成,距离远会"遗忘"。Transformer(2017 注意力机制)谷歌论文《Attention Is All You Need》:直接看全文,建模词元间整体关系,跨时代。GPT-3(2020)→ 公众视野(2022)GPT-3(1750亿参数)能力"涌现";ChatGPT 让大模型进入大众视野。工程学习 = 在前人基础上不断改进迭代,而非一步到位。

三、神经网络基础:激活函数 + 反向传播

神经元之间用"边"连接,每条边有权值(即参数)。仅做线性运算只是传导器,加激活函数才带来"非线性决策";再用损失函数比较预测值与真实值,通过反向传播对参数求梯度(斜率)并逐层反向修改,直到逼近真实。这套底层逻辑早在 1980 年代就成熟。

输入层文本/图片隐藏层矩阵运算+激活函数输出层各token概率损失函数预测值 vs 真实值反向传播梯度下降调参图片识别:带标签数据 → 预测 → 算差值 → 反向修改参数 → 逼近真实新图片进来即自动抽取特征、给出判断

四、Transformer 整体架构:编码器 + 解码器

Transformer 宏观分编码器(理解输入)解码器(生成输出)。编码器把读入的信息(文本/图片/视频)抽取成特征;解码器通过"完形填空"(盖住约15%词元去预测)训练出语言前后关联,并借助交叉多头注意力读取编码器输出的 K/V。

编码器 Encoder(理解输入)输入 → 词嵌入 → 位置编码多头自注意力(建立词元全关联)Add & Norm(残差+层归一化)前馈网络层(抽取特征)Add & Norm → 输出给解码器解码器 Decoder(生成输出)输出(右移) → 词嵌入 → 位置编码掩码多头自注意力(完形填空)Add & Norm交叉多头注意力(读编码器K/V)Add & Norm前馈网络层Add & Norm → 输出生成K/V

五、位置编码:让模型知道"词在哪儿"

词嵌入把句子拆成矩阵后丢失了顺序("Are you OK" 与 "You are OK" 词元相同但含义不同),必须补位置信息。位置编码经历了多次迭代:

① 固定正弦/余弦(论文原始)奇偶位算法不同,直接叠加;固定不可调、难延伸上下文窗口。② 可学习绝对位置(BERT / GPT-2 / GPT-3)加隐藏层自动学位置;简单但难延伸长上下文。③ 相对位置编码除记录自身位置,还记录词元间相对距离。④ 旋转位置编码 RoPE(千问 / Llama 主流)既记绝对又靠"旋转"记相对;兼顾效率与长文本,当今主流。⑤ 线性衰减偏置(砍掉位置层)注意力层加线性衰减惩罚;长文本准确性稍差。

六、注意力机制:QKV 计算

注意力机制直接获取全局信息,建立词元间联系,且可并行——优于 RNN(串行、易遗忘)和 CNN(需堆叠多层才感受全局)。核心是把输入分别乘以三个矩阵得到 Q(查询)、K(键)、V(值):Q 与 K 做矩阵乘、除以 √dk 缩放、经 Softmax 归一化为权重,再乘以 V 得到注意力输出。多头注意力 = 分多个角度并行关注、信息互补。

输入× Wq → Q× Wk → K× Wv → VQ·Kᵀ ÷ √dkSoftmax 归一化× V注意力输出(词元间关联权重)V直送多头注意力:分多个"头"并行关注不同角度(主谓/人物地点/动作对象),信息互补掩码多头 = 完形填空;交叉多头 = 解码器用编码器的 K/V

七、激活函数、相加归一化与三类架构

激活函数赋予非线性:ReLU(最早)、GELU(高斯线性误差,平滑可微,利于反向学习)、SwiGLU(GELU+门控,增强表达能力,当今主流)。相加 & 归一化(Add & Norm):残差连接把原信息直送下一层防止丢失;论文原版"先加后归一",后改进为 Pre-Norm(先归一再加),再演进到 RMS Norm(用均方根,计算量更小)。

三类架构:① 解码器-only(因果解码器,当今主流,重点在"生成");② 编码-解码器(如 T5);③ 编码器-only(如 BERT)。模型规模标注如 175B = 1750亿参数。

八、Transformer 的短板与优化

短板一:计算复杂度约 O(n²)(矩阵朴素立方,已优化到约 n^2.37),文本过长算力吃不消;短板二:存储爆炸——KV Cache 随长度 n 增长(1k token ≈ 2.6G,128k ≈ 300G+)。优化方向:

💡 优化手段:MQA(多查询注意力,单 K/V 共享,省缓存但降性能)→ GQA(分组查询,折中)MoE 混合专家(路由选专家,不全量运算);SSM 状态空间(用数学降维处理长文本)。本质都是在性能与效率间找平衡

九、第一轮真题:理解架构即简单

第一轮为选择题(扫盲级),理解架构后题不难,如"QKV 计算过程"直接可选出答案。重点是把上文的架构讲清楚——大纲与样题多为"知不知道"的考查。

十、第二轮上机环境配置(实战重点)

考试流程:开考→指令获取文档→在 VS Code 编辑作答→提交。考场已配好环境,无需自己装库;本地搭建用于模拟练习。徐老师给出"先懂原理再装"的踩坑经验(版本不对会疯狂报错):

① 安装 Python要求 3.9+,建议 3.10(太新反而易不兼容);安装时勾选"添加到环境变量"。② 安装 PyTorch 2.6必须 2.6(最新版不兼容);有独显选 CUDA 版,否则选 CPU 版。③ 安装 Transformerspip install transformers(慢可加清华镜像)。④ 安装 VS Code装中文包 + Code Runner 插件,点击即可运行 Python。⑤ 下载权重 + ⑥ 解题 submission.py + ⑦ 跑 evaluate.py去年权重=千问3 0.6B(git clone);改 submission 写提示词/函数;evaluate 有 demo(看过程)/greedy(看得分) 两模式。

十一、真题实战要点(T1 写提示词 / T2 增强检索)

T1(写提示词,约50分):明确角色 → 说清任务与输出格式 → 给示例让模型学 → 用 demo 模式看过程再改提示词。生成参数:do_sample=false(贪心,结果唯一)、temperature/top_p 设 false、开启 thinking。评测为字符精确匹配,错一个字符不得分;不要打表(拿测试集过拟合)。注意末端提示效应:提示词并非越多越好,前面的会被稀释遗忘,重要内容放后面更有效。

T2(增强检索,约50分):调用给定诗库实现检索函数。徐老师强调读懂题意比背高级语法更重要:用 for/if 即可完成;忘了函数用法用 dir()/help() 查离线说明;用打印调试法看程序走到哪步。

十二、互动 Q&A 要点

• 中学生学理论难吗? 需两块数学:导数(理解梯度下降)+ 线性代数(矩阵乘法);能学懂高中数学就不算难,且是"学别人已提出的",比自创算法门槛低。
• 笔试能带计算器吗? 第一轮是选择题(扫盲),按道理不能,以官方说明为准。
• 环境是 Windows 还是 Linux? 考场已配好无需自配;本地以 Windows 演示为主,VS Code 内操作大同小异,以官方通知为准。
• Python 3.8 行吗? 不行,要求 3.9+(CUDA/PyTorch 也要求 3.9+),建议按官方版本配,少踩坑。
• 配环境遇错可问大模型,但大模型并非全对,关键处要查官方文档或问懂行的人。

一句话总结:大模型 = 用 Transformer(词嵌入+位置编码+多头注意力+前馈+Add&Norm)堆叠出的"预测下一个词"的复合函数;训练靠反向传播调参。LMCC 一轮考概念(理解架构即可),二轮考上机(配环境→写提示词/改代码→evaluate 评测)。别傻瓜式安装,懂原理换模型也会配才是有效学习。

交流群,失效联系:wswrlm
8:《大模型架构与LMCC第一轮真题选讲》 《LMCC 第二轮认证上机环境配置与选讲》-第1张图片-四季读书网

抱歉,评论功能暂时关闭!