AI监考之后:3000份试卷作废,5.8万人被叫回考场

四季读书网 3 0
AI监考之后:3000份试卷作废,5.8万人被叫回考场
AI监考之后:3000份试卷作废,5.8万人被叫回考场-第1张图片-四季读书网

今年5月至6月,墨西哥国立自治大学首次把本科入学考试全面搬到线上。超过15万名考生在家完成考试,锁屏浏览器、AI摄像头和人工监考同时运行。成绩公布后,高分比例却突然偏离过去五年的分布。学校没有找到每一名作弊者,最终接受专家委员会建议,让约5.8万人参加线下控制考试。

重点速览

  • 这不是“AI判定5.8万人作弊”。约3,000份试卷因违规被作废,更多考生受到的是整体成绩可信度危机影响。
  • 120道题中,100分以上考生占比从过去五年的3.5%升至16.3%;110分以上占比从0.9%升至5.5%。
  • 监考系统能限制当前电脑、观察摄像头画面并生成异常提醒,却无法覆盖镜头之外的设备、人员和信息来源。
  • 专家委员会建议用线下考试重新验证结果,诚实应试者也要承担时间、交通和机会成本。

超过15万人,第一次在家参加入学考试

AI监考之后:3000份试卷作废,5.8万人被叫回考场-第2张图片-四季读书网
远程监考同时依赖锁屏浏览器、摄像头算法和人工复核

墨西哥国立自治大学是该国规模最大、竞争最激烈的公立大学之一。CNN披露,2026年本科入学考试对应21,962个名额,参加考试的人数超过15万。

往年,考生需要到指定地点完成考试。今年是这所大学第一次全面采用远程方案。考试分布在5月下旬至6月上旬的多个时段,考生在自己的电脑前答完120道选择题。

监考并不是只靠一个摄像头。

考生需要运行Respondus LockDown Browser。考试开始后,浏览器会限制打印、复制、切换网站、打开其他应用和即时通信等操作。摄像头监考由Territorium提供,算法观察考生是否离开画面、是否出现第二个人、手机或耳机。系统发现异常后向人类监考员发出提醒,约每150名考生配置一名监考员。

从产品结构看,这是一个相当完整的远程监考组合:电脑端封闭操作环境,摄像头监控现实空间,算法筛选异常,再由人工处理提醒。

它确实抓到了一部分问题。约3,000份试卷因违反考试规则被作废,占全部考试的约2%。

真正让学校无法继续发放录取结果的,并不是这些已经被定位的违规记录,而是整批成绩出现了无法用正常波动解释的变化。

高分曲线突然改变,但统计异常不是个人证据

2021年至2025年,120道题中得到100分及以上的考生约占3.5%。2026年,这一比例升至16.3%。

更高分段的变化更明显。过去五年,110分及以上考生约占0.9%;今年达到5.5%。两条曲线都不是小幅上扬,而是短时间内成倍增加。

异常分布可以说明考试过程可能出了问题,却不能回答另一个更具体的问题:究竟是谁获得了不当帮助,又使用了什么方法?

UNAM官方在8月3日的说明中使用了“涉嫌违规”和“大量考生可能得到帮助”等措辞。专家委员会仍将继续调查,以查清事件并划分责任。

现有公开信息提到多种可能性:镜头外放置第二块屏幕,用隐藏耳机接收答案,让其他人在画面外协助,提前取得题目,或者由他人代考。它们并不都需要在考试电脑上运行软件,也不一定会触发同一种摄像头异常。

因此,不能把高分增长直接换算成作弊人数,也不能因为一名考生进入异常分段,就认定其个人作弊。统计曲线证明的是结果需要复核,不是每个人的责任已经得到证明。

AI监考看到的是信号,不是完整现场

锁屏浏览器控制的是当前电脑。第二台设备、纸质材料和画面之外的人员,不在这条控制边界内。

摄像头算法控制的也不是房间本身,而是一个固定视角。它能发现人脸消失、额外人员进入或疑似设备,却无法知道镜头外发生了什么。考生短暂低头、网络卡顿或画面质量下降,也可能生成需要人工判断的提醒。

人类监考员接到提醒后可以复核,但1比150的配置意味着注意力首先要交给系统分配。算法没有标出的画面,不会获得同等程度的人工观察。

这套系统完成的是异常检测:把少量值得检查的片段从海量视频中挑出来。学校随后面对的却是高风险决策:谁能获得稀缺的大学名额,谁应被取消资格,谁需要重新考试。

异常检测和资格裁决之间,还缺少一条能够落到个人的证据链。UNAM事件中,这条证据链只覆盖了约3,000份已被作废的试卷,无法解释整个高分分布的变化。

约5.8万人承担了一次集体复核

AI监考之后:3000份试卷作废,5.8万人被叫回考场-第3张图片-四季读书网
结果无法获得信任后,约5.8万人可能重新参加线下考试

专家委员会最后提出“控制考试”:已收到录取通知的考生,以及分数达到2021年至2026年相应专业、校区和培养方式最低录取线的人,都要参加新的线下考试。录取名额按照这次考试的结果重新分配。

CNN与Ars Technica估算,受影响者约为5.8万人。

这个范围远大于已经被作废的约3,000份试卷。它包含今年原本可以被录取的人,也包含成绩达到历年门槛、却可能因异常高分挤压而落选的人。

校长Leonardo Lomelí接受了委员会建议。他同时向那些诚实考试、已经被录取却仍需再次应试的人道歉,称线下控制考试是恢复确定性和入学公平所必需的措施。委员会也明确表示,控制考试只是完成当前招生流程的紧急办法,调查并未结束。

对大学而言,这是一种保守但能执行的纠偏:既不承认原成绩完全有效,也不在证据不足时把高分考生集体定性为作弊者,而是重新取得一组更可比较的线下成绩。

代价没有消失。准备第二次考试、前往考场、等待新的录取结果,以及原定学期安排的不确定性,都由考生承担。其中包括已经按规则完成第一次考试的人。

监控、证据和决定,是三件不同的事

UNAM事件常被概括为“AI监考失败”。这句话只描述了结果,没有说明失败发生在哪一层。

监控层并非完全失效:系统识别并处理了部分违规。证据层出现了缺口:被记录的个人异常不足以解释整体成绩变化。决策层只能在两种风险之间选择:接受一批可信度受损的成绩,或者让大范围考生重新接受验证。

同样的结构也会出现在招聘测评、保险审核、支付风控和身份验证中。系统可以筛选异常、提高检查效率,但“值得检查”不自动等于“已经违规”。当机构把风险信号直接当成最终结论,误判会落到具体个人;当机构不敢采用系统结论,又缺少其他证据时,复核成本仍会回到个人身上。

这场考试目前没有证明AI制造了异常,也没有证明远程考试必然不可信。已经确认的事实更有限:一套包含锁屏浏览器、AI摄像头和人工监考的系统,未能为一次高竞争入学考试提供足以让所有人接受的结果。

UNAM选择用线下考试重建信任,却无法把第一次考试耗费的时间还给考生。技术可以扩大监控范围,但当结果进入录取、就业和金融等高风险场景,真正稀缺的不是更多提醒,而是能够经受质疑的证据。

下一次机构准备让算法参与重大资格判断时,是否已经提前回答:如果系统只能发现异常、却不能证明责任,最后的复核成本由谁承担?

话题标签

#AI监考#线上考试#教育公平#人工智能治理#远程监考

抱歉,评论功能暂时关闭!