期中期末最怕的不是「多出几道题」,而是卷子已经发下去、成绩已经录进去,才发现选项无解、答案自相矛盾、超纲或表述错误。DeepSeek、豆包、通义等通用大模型能在半小时内拉出一整套卷——也正因如此,错题一旦进了正式考试,归责往往比「改一道题」麻烦得多。公开讨论与教研实践里较稳的共识是:AI 是辅助工具,命题终审与成绩解释仍在人;学校要有流程,平台侧也难替你背「校内评价责任」。本文用三类可复现的翻车形态,把「谁负责」说到能落地的人机分工与补救清单上(文中案例为课堂常见失败模式的复合复盘,非点名某校)。

一、先分清:草稿错、正式卷错、成绩已生效
| 命题教师/备课组终审责任 | ||
法律与政策讨论里,生成式 AI 多被当作服务/工具,不是「自动命题官」。对校内高利害评价而言:谁决定把这道题印进卷子,谁就要对正确性负责——通常是教师与学校的组织流程,而不是「模型自己」。

二、三类真实翻车(复合复盘)
类型 A:看起来严谨,实际无解或双答案
常见表现:选择题四个选项互不独立、条件缺省、图文不符;或「标准答案」与解析互相打架。模型擅长像真题,不保证可唯一作答。
- 谁先背锅
:把 AI 草稿直接定稿的命题人 / 备课组终审人。 - 学校角色
:若缺少「双人审题」或「试做」制度,组织管理也会被追问。 - 模型/平台
:可作技术原因说明,一般不能替代校内评价责任。
类型 B:知识点串台或超纲
常见表现:把高一内容写进初二卷、把选修当必修必考、情境题引用错误史实/实验数据。家长质疑点往往是「孩子按课标复习却被超纲题打懵」。
- 谁先背锅
:未对照课标与校本进度核验的命题教师。 - 补救
:超纲题作废或给全体相应分数处理,并书面说明依据。
类型 C:答案键错误,成绩已生效
常见表现:填空数值单位错、多选题漏选标准、作文量规条目与示例不一致;阅卷按错键推进后才发现。
- 谁先背锅
:答案键制作与终审人(常与命题人同一团队)。 - 学校必须做
:停用错误键、重评或分数校正、向学生家长说明口径,避免「悄悄改分」。

三、责任怎么切:一张分工表
国内外教育实践里的同一句话:AI 可以起草测评材料,专业判断不能外包。 高利害考试尤其如此。

四、本周可落地:发卷前 20 分钟终审清单
角色:命题终审助手(只辅助检查,不替代教师签字定稿)。任务:审阅以下「AI 起草试卷草稿」,找出可能导致正式考试翻车的问题。输入:{{学科}} {{学段}} {{考试类型}};课标/校本范围:{{范围说明}};试卷正文与答案键:{{粘贴内容}}请输出:1) 无解/双答案风险题(题号+原因)2) 超纲或进度不符题3) 答案键与解析不一致处4) 建议删除/修改/保留(保留须说明理由)5) 「必须人工试做」的题号列表禁止:宣称已可作为正式卷直接印刷;编造课标条文编号。
人工仍要完成三步:自己做一遍客观题、对照课标删超纲、两人交叉看答案键。AI 审稿只能缩小漏网,不能当你的签字。
已经发出去了怎么办(最短路径)

五、红线

六、小结
- 谁负责
:正式卷与成绩解释的责任在命题终审的人与学校流程;AI 是原因之一,不是免责金牌。 - 三类翻车
:无解/双答案、超纲串台、答案键错误——都可在发卷前用试做与双审拦住大半。 - 本周动作
:用终审提示词过一遍草稿 → 人工试做 → 双人核键 → 再印刷。 - 已出错时
:固定证据、统一给分规则、公开纠偏口径、补流程。 - 边界
:生成式出题可以提速,不能替代课标把关与教师签字。
通用模型如 DeepSeek、豆包 适合出题草稿与审稿辅助;是否进入正式考试,请以课标、校本规范与备课组终审为准。