2026年南京市中考命题技术和评价素养培训
四季读书网
12
2026年南京市中考命题技术和评价素养培训
依标命题,难度适宜,教考衔接:课程标准——教学标准——命题标准技术:让教师有教的技术,学生有学的技术,是专业的一部分。二、考试请评价工具开发的基本问题——来自教育测量学视角本次培训由参与过新课标修订的张咏梅研究员主讲,从教育测量学视角讲解新课标下素养导向的考试评价开发方法,分享了命题框架、命题蓝图等实操内容,以及北京团队在测评领域的最新研究进展。主讲人背景介绍访学与课标参与经历:主讲人曾获国家留学基金委委派,作为高级学者赴美国ETS访学1年,2018年起进入国家义务教育课程标准综合组,后续参与了高中课标修订中考试评价部分的制定工作。分享内容定位说明:本次分享的内容、案例均经过课堂教学实践检验,并非纯理论内容。说明学科定义与范畴:教育测量学是研究考什么、怎么考、怎么评分、怎么报告和解释学生分数的专业领域,测量对象包含能力、情感态度、价值观、行为等,属于跨学科领域,适用于所有学科。学科归属与应用场景:在我国教育测量学属于教育心理学范畴,归大学心理系;美国归教育学院。适用的三类考试:适用于教师日常考试(单元测评、期中期末考)、活动类与表现类评价(实验操作、演讲、项目学习成果评价)、大规模高风险测评(中考、高考、会考)三类考试,三类考试均被国家课标涵盖。测评目标:强调核心素养立意与整体性:核心素养不只是知识与技能,是在特定情境中调动心理社会资源满足复杂需要、解决实际问题的能力。命题需要创设真实情境,考察学生解决问题的能力;素养考察强调整体性,不主张拆分知识点单独考察,避免破坏素养的整体性。测评设计:强调证据中心原则:要求评分依据核心素养内涵、学业质量、任务完成过程研制评分标准,明确分数等级、作答特征和典型作答样例,保障不同评分者对同一作答的评分标准一致,大规模测评必须提前准备好各等级的样例与解读。测评方式:强调多元评价突出过程性功能:新课标倡导纸笔测试、计算机互动、表现型评价、档案袋评价、过程评价等多元方式,全方位提取学生学习证据,得到更全面公正的评判;不同评价方式能收集不同类型的证据,可相互补充,大规模测评对试题质量和效度的要求是所有评价中最高的。测评效能:强调对全环节的技术赋能:北京团队目前在做基于学习进阶的诊断性测评,也探索了AI命题和AI评分;当前素养导向命题在全球都属于研究探索阶段,AI工具应用需警惕效度问题,大规模高风险测评中使用AI需要非常审慎。考试评价工具开发的基础理论学业质量标准的核心地位:学业质量标准是大规模测评命题的直接依据,新课标特别强调整体刻画素养、结构化课程内容,避免碎片化考察,所有开发都需要以核心素养为核心依据。评价三角理论:该理论由OECD在2023年创新评价报告中提出,要求有效测评结合认知、观察、解释三个环节:认知对应学业质量标准,明确评价目标;观察对应命题任务,引发学生符合考察目标的表现;解释对应评分,需要回到学业质量标准对学生表现进行解释,形成闭环。证据中心设计原则:本质是获取支撑学生素养判断的证据,并基于学业质量标准分析解释证据。命题需要保证试题和考察目标有清晰的映射关系,提前预设学生可能的表现和评分分级,命题需要多轮打磨,至少需要8-10道工序保证效度,当前国内素养导向命题普遍存在评分标准仍回到知识点考察的问题。开发步骤区分:校内日常测评基本步骤为7步,目标以诊断教学、促进学习为主;大规模高风险测评基本步骤为12步,包含制定计划、界定框架、命题、预试、阅卷、划定分数线、题目入库、撰写技术报告等,每个题目需要标注难度、区分度等技术指标。考试性质分类:分为常模参照类和标准参照类,常模参照类用于区分选拔,依据学生在群体中的相对位置解释成绩,命题需要优先选择区分度高的试题,避免过易或过难;标准参照类依据明确的课程/学业质量标准解释成绩,达到标准即可,命题需要优先选择能代表标准要求的关键试题,区分度只要不为负即可。中考的混合性质:中考兼具毕业资格(标准参照)和升学选拔(常模参照)的双重属性,命题需要明确每道题的功能,合理分配不同功能试题的分数占比,是现实要求和技术要求之间的妥协。日常校内测评多数属于标准参照类。命题蓝图的核心作用:命题蓝图是命题的基础,能明确试题和课标、素养的关联,保证试题效度;北京要求所有提交的成套试卷,第一个提交内容就是命题蓝图。命题蓝图的核心构成:包含三个部分:第一是类属特征,明确测查指向对应的学业质量标准水平、考察的学科核心素养维度、情景类别、对应课程模块/任务群,需要把握适当的颗粒度,兼顾整体性和可操作性;第二是基本特征,包含认知复杂度、题型、文字量、图表数量,要求文字量简洁,避免因冗余文字增加无关的阅读负担,北京已经开始监控各年级试卷的总文字量,不同地区同年级同科目的文字量差异可达到一倍。命题蓝图的测量学特征:要求标注预计难度、预计作答时间、每题分值、评分标准、试题来源;评分标准需要和考察目标对应,要从素养维度而非仅知识点维度制定,比如考察建模能力,需要从模型表征、解释、预测、修订的维度分级,不能仅看知识点对错。命题蓝图的整体逻辑:命题蓝图完整对应评价三角的逻辑,测查指向对应认知,任务属性标定对应观察,评分标准对应解释,形成完整的证据链。命题蓝图样例说明语文主观题样例标定:样题为高二期末语文考试题,题目要求学生结合古诗词学习经验,谈对“古诗词是必需品还是调味品”的看法,150字左右,改编自教材单元研习任务。按照命题蓝图标定,测查指向高中学业水平二(合格考要求),考察语文核心素养中思维发展与提升的逻辑思维,情景为社会生活+个人体验情景,属于中华传统文化经典研习任务群,认知复杂度对应韦伯深度模型3级,题目为中等难度。样例评分标准设计:该题评分围绕逻辑思维的判断、论证两个核心要素设计,明确不同等级的描述,并配上学生作答样例和解读,保证所有评分者对评分标准的理解一致;评分本质是对学生作答的编码,素养无法直接观察,需要通过清晰的编码规则从学生作答中提取证据。过程性评价的蓝图设计核心逻辑与简化要求:过程性评价同样遵循评价三角逻辑,目的是寻找素养证据,可以简化类属等内容,重点明确诊断问题和提升建议。核心要求:过程性评价核心是三大项:明确学生当前水平、目标水平、如何帮助学生达到目标;核心三要素是目标任务、证据评价、反馈改进,其中反馈对学生学习的促进作用最大,远比大量刷题有效。评价中的支架设计:支架是帮助学生达到更高理解水平的工具,包含评分量规、句式框架等,可帮助学生展现思维过程,方便命题者获取证据;支架可分为能力支架、内容支架,在教学和评价中可以采用逐步撤出支架的方式培养学生能力:初期提供内容+能力支架,中期保留能力支架撤出内容支架,最终完全撤出支架,培养学生独立的思维能力。计算机化情景交互测评开发:北京教研系统目前已经开发了3套市级计算机化测评系统,在6000多名初一、高一学生中完成测试,实现了科学领域综合考察,采用多模态表达、人机交互、三维场景设计,可完整记录学生作答的过程性数据(反应时、看视频次数、修改次数等);研究发现,在创新思维测评中,学生能力水平和作答速度呈显著负相关,深度探索型学生(约占10%)得分最高。大语言模型自动评分研究:北京团队和中国科大合作开展人机协同自动评分研究,目前素养导向主观题评分和人工评分的一致性可达到85%,机器和人工评分的一致性比不同人工之间的一致性更高;计划用AI替代一位人工评分员,最终终审权仍保留在人手中,出现较大误差时由人工复核。
版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至23467321@qq.com举报,一经查实,本站将立刻删除;如已特别标注为本站原创文章的,转载时请以链接形式注明文章出处,谢谢!