讲师名片:徐宝义,西安市铁一中学信息学竞赛教练,陕西省优秀教练员、NOI 优秀教师,累计指导逾150人次获全国青少年信息学奥林匹克竞赛一等奖,学生获 NOI 金牌1枚、银牌14枚、铜牌6枚、1人入选国家集训队、4人获国际初中生信息学竞赛金牌。本讲系统串讲大模型架构(神经网络→Transformer→位置编码→注意力),并给出LMCC 第二轮上机环境配置与真题实战要点。
一、开场:从学界大事看"为什么学大模型"
8月11日前后,Anthropic 未公开模型(疑似 Claude Opus 4.5)将黎曼猜想的临界值从 41.6% 提升到 67.2%;此前还用模型找到了雅可比猜想的一个反例。大模型能力已远超一两年前的认知——不仅能解答人类已知问题,还能在已有逻辑上推演、突破未知边界。
对信息学竞赛(NOI)选手而言,学 LMCC / 大模型真正补上的是工程思维:竞赛是"限定时间解题",而真实世界的问题往往没有边界。徐老师引用吴军对工程思维的概括:
💡 工程思维四要点:① 边界内做事(承认理论极限,不徒劳造永动机);② 追求闭环与落地;③ 化繁为简(复杂问题拆模块再重组);④ 系统迭代升级(不幻想一次性成功,遇问题再改)。另含真实问题拆解能力、查阅文档/论文能力、AI 时代交叉验证的判断力(多平台、多方法验证真伪与幻觉)。
二、大模型发展简史:站在前人肩膀上的迭代
技术不是突然成熟的,而是一步步迭代优化:从统计语言模型,到序列模型,再到"全文注意力"的 Transformer,最后涌现出惊艳能力。
三、神经网络基础:激活函数 + 反向传播
神经元之间用"边"连接,每条边有权值(即参数)。仅做线性运算只是传导器,加激活函数才带来"非线性决策";再用损失函数比较预测值与真实值,通过反向传播对参数求梯度(斜率)并逐层反向修改,直到逼近真实。这套底层逻辑早在 1980 年代就成熟。
四、Transformer 整体架构:编码器 + 解码器
Transformer 宏观分编码器(理解输入)与解码器(生成输出)。编码器把读入的信息(文本/图片/视频)抽取成特征;解码器通过"完形填空"(盖住约15%词元去预测)训练出语言前后关联,并借助交叉多头注意力读取编码器输出的 K/V。
五、位置编码:让模型知道"词在哪儿"
词嵌入把句子拆成矩阵后丢失了顺序("Are you OK" 与 "You are OK" 词元相同但含义不同),必须补位置信息。位置编码经历了多次迭代:
六、注意力机制:QKV 计算
注意力机制直接获取全局信息,建立词元间联系,且可并行——优于 RNN(串行、易遗忘)和 CNN(需堆叠多层才感受全局)。核心是把输入分别乘以三个矩阵得到 Q(查询)、K(键)、V(值):Q 与 K 做矩阵乘、除以 √dk 缩放、经 Softmax 归一化为权重,再乘以 V 得到注意力输出。多头注意力 = 分多个角度并行关注、信息互补。
七、激活函数、相加归一化与三类架构
激活函数赋予非线性:ReLU(最早)、GELU(高斯线性误差,平滑可微,利于反向学习)、SwiGLU(GELU+门控,增强表达能力,当今主流)。相加 & 归一化(Add & Norm):残差连接把原信息直送下一层防止丢失;论文原版"先加后归一",后改进为 Pre-Norm(先归一再加),再演进到 RMS Norm(用均方根,计算量更小)。
三类架构:① 解码器-only(因果解码器,当今主流,重点在"生成");② 编码-解码器(如 T5);③ 编码器-only(如 BERT)。模型规模标注如 175B = 1750亿参数。
八、Transformer 的短板与优化
短板一:计算复杂度约 O(n²)(矩阵朴素立方,已优化到约 n^2.37),文本过长算力吃不消;短板二:存储爆炸——KV Cache 随长度 n 增长(1k token ≈ 2.6G,128k ≈ 300G+)。优化方向:
💡 优化手段:MQA(多查询注意力,单 K/V 共享,省缓存但降性能)→ GQA(分组查询,折中);MoE 混合专家(路由选专家,不全量运算);SSM 状态空间(用数学降维处理长文本)。本质都是在性能与效率间找平衡。
九、第一轮真题:理解架构即简单
第一轮为选择题(扫盲级),理解架构后题不难,如"QKV 计算过程"直接可选出答案。重点是把上文的架构讲清楚——大纲与样题多为"知不知道"的考查。
十、第二轮上机环境配置(实战重点)
考试流程:开考→指令获取文档→在 VS Code 编辑作答→提交。考场已配好环境,无需自己装库;本地搭建用于模拟练习。徐老师给出"先懂原理再装"的踩坑经验(版本不对会疯狂报错):
十一、真题实战要点(T1 写提示词 / T2 增强检索)
T1(写提示词,约50分):明确角色 → 说清任务与输出格式 → 给示例让模型学 → 用 demo 模式看过程再改提示词。生成参数:do_sample=false(贪心,结果唯一)、temperature/top_p 设 false、开启 thinking。评测为字符精确匹配,错一个字符不得分;不要打表(拿测试集过拟合)。注意末端提示效应:提示词并非越多越好,前面的会被稀释遗忘,重要内容放后面更有效。
T2(增强检索,约50分):调用给定诗库实现检索函数。徐老师强调读懂题意比背高级语法更重要:用 for/if 即可完成;忘了函数用法用 dir()/help() 查离线说明;用打印调试法看程序走到哪步。
十二、互动 Q&A 要点
• 中学生学理论难吗? 需两块数学:导数(理解梯度下降)+ 线性代数(矩阵乘法);能学懂高中数学就不算难,且是"学别人已提出的",比自创算法门槛低。
• 笔试能带计算器吗? 第一轮是选择题(扫盲),按道理不能,以官方说明为准。
• 环境是 Windows 还是 Linux? 考场已配好无需自配;本地以 Windows 演示为主,VS Code 内操作大同小异,以官方通知为准。
• Python 3.8 行吗? 不行,要求 3.9+(CUDA/PyTorch 也要求 3.9+),建议按官方版本配,少踩坑。
• 配环境遇错可问大模型,但大模型并非全对,关键处要查官方文档或问懂行的人。
一句话总结:大模型 = 用 Transformer(词嵌入+位置编码+多头注意力+前馈+Add&Norm)堆叠出的"预测下一个词"的复合函数;训练靠反向传播调参。LMCC 一轮考概念(理解架构即可),二轮考上机(配环境→写提示词/改代码→evaluate 评测)。别傻瓜式安装,懂原理换模型也会配才是有效学习。
