Jev 高考实测:1497 道单选题得分率 90.85%,数学拖了后腿 2026.9.22

四季读书网 8 0
Jev 高考实测:1497 道单选题得分率 90.85%,数学拖了后腿 2026.9.22
作者:大大(大大的小数据)

如果让 AI 去参加高考,能考多少分?

这问题不好回答——主观题怎么判?作文怎么打分?评分标准谁来定?

所以我换了个思路:拿 Jev 来做高考单选题。1497 道,一道一道让它答,再一道一道跟标准答案比对。

Jev 是 TypeSafe AI 出的一个决策模型(System One),官方定位很克制——不擅长需要长链条推理的任务,擅长"在明确选项里做判断"。这次就把它这段自述,拿去实测一遍。

成绩单先亮出来:

Jev 高考实测:1497 道单选题得分率 90.85%,数学拖了后腿 2026.9.22-第1张图片-四季读书网
全部数据、逐题明细与代码已开源:github.com/kuaitoukuai/jev-gaokao-eval(文末有说明)

一个总分说明不了什么。真正有意思的是拆开之后——它强在哪、弱在哪、什么时候可以信它、什么时候绝对不能信。

下面慢慢说。

一、先交代口径:这 1497 道题是怎么筛出来的

题目来自上海交大 OpenLMLab 开源的 GAOKAO-Bench,收录 2010–2022 年各地高考的客观题。

题库一共 1781 道,但不是每道都能这么测

Jev 高考实测:1497 道单选题得分率 90.85%,数学拖了后腿 2026.9.22-第2张图片-四季读书网

这里有个容易踩的坑:那 23 道多选题,答案是 ['AC'] 这样存在数组里的,数组长度也是 1——只看长度会被误判成单选题。必须同时检查元素内容长度才筛得干净。

1503 道单选题里再扣掉 6 道(选项是图片、或题干编码损坏,文本接口处理不了),最终可测 1497 道

口径说清楚了,下面的数字才有意义。

二、这一批题,一共花了多少钱

先放一张账单,因为它可能比准确率更让人意外。

Jev 高考实测:1497 道单选题得分率 90.85%,数学拖了后腿 2026.9.22-第3张图片-四季读书网

图 1 Jev 服务控制台的用量账单

Jev 高考实测:1497 道单选题得分率 90.85%,数学拖了后腿 2026.9.22-第4张图片-四季读书网

1873 次请求里,1497 次是这次全量评测,剩下约 376 次是前期各种测试。

单次请求均价大约 0.000022 美元。 一万次调用两毛多美元。

这个价位意味着什么?意味着"让 AI 跑一遍数据"这件事,已经便宜到不需要犹豫了。

三、分学科:差距比想象中大

总分 90.85% 是个平均值,一拆到学科,落差立刻显出来

Jev 高考实测:1497 道单选题得分率 90.85%,数学拖了后腿 2026.9.22-第5张图片-四季读书网

图 2 分学科得分率(绿色高于总体,橙色低于总体)

Jev 高考实测:1497 道单选题得分率 90.85%,数学拖了后腿 2026.9.22-第6张图片-四季读书网

规律非常干净:政治、生物、英语、语文都在 93% 以上;数学 I、数学 II 掉到 86% 和 81%。

文科和记忆型学科明显强,需要多步计算的最弱。而且注意最后一列——Jev 在数学上的平均置信度也是最低的(0.723 / 0.765),说明它自己也知道数学没把握。

四、换个维度:年份、分值、题干长度

年份:老题不比新题更容易

如果 Jev 是靠"见过"来答题,理论上越老的题越容易(流传更广、语料更多)。

实测数据不支持这个推论

Jev 高考实测:1497 道单选题得分率 90.85%,数学拖了后腿 2026.9.22-第7张图片-四季读书网

图 3 各年份得分率,虚线为总体均值

Jev 高考实测:1497 道单选题得分率 90.85%,数学拖了后腿 2026.9.22-第8张图片-四季读书网

2011 最高、2019 最低,中间上上下下。这条曲线看起来更像随机波动,而不是"越老越熟"。

不过要提醒一句:这不能证明没有数据污染——只能说"污染如果存在,也没有表现为按年份的阶梯"。真想排除污染,得用没公开过的题。

分值:5 分题是个明显的坑

Jev 高考实测:1497 道单选题得分率 90.85%,数学拖了后腿 2026.9.22-第9张图片-四季读书网

5 分题一枝独秀地低(83.53%),比 4 分题低了 10 个百分点以上。分值高往往意味着更综合、更需要推理,这跟数学弱的现象是一致的。

题干长度:太长就开始吃力

Jev 高考实测:1497 道单选题得分率 90.85%,数学拖了后腿 2026.9.22-第10张图片-四季读书网

200–400 字的题反而最高(92.28%)——信息给得足,题反而好判断

真正的问题是超长题干:400 字以上直接掉到 80%。不过这两档样本太少(15 题和 5 题),只能当参考,不能当结论

五、Jev 知道自己会不会——这是最有价值的部分

每次作答,Jev 不只给答案,还给一组概率分布。把置信度和实际正确率画在一起,就能看出它"心里有没有数"。

Jev 高考实测:1497 道单选题得分率 90.85%,数学拖了后腿 2026.9.22-第11张图片-四季读书网

图 4 置信度 vs 实际正确率(虚线是完美校准线)

Jev 高考实测:1497 道单选题得分率 90.85%,数学拖了后腿 2026.9.22-第12张图片-四季读书网

两个关键读数:

第一,曲线整条都在对角线上方。 七个分档的偏差全是正的——实际正确率普遍高于它自报的置信度。翻译成人话:它系统性地低估自己。这在工程上是安全方向(宁可说自己没把握,也不吹牛)。

第二,置信度真的能分出"会"和"不会":

Jev 高考实测:1497 道单选题得分率 90.85%,数学拖了后腿 2026.9.22-第13张图片-四季读书网

置信度低于 0.40 的 109 道题,正确率只有 45.0%——基本等于抛硬币。

六、用置信度当闸门,能省多少人工

如果拿置信度做"自动通过 / 转人工"的开关,收益是这样的:

Jev 高考实测:1497 道单选题得分率 90.85%,数学拖了后腿 2026.9.22-第14张图片-四季读书网

图 5 置信度门槛的收益(浅蓝柱=能自动处理的题目占比,绿线=自动处理的正确率)

Jev 高考实测:1497 道单选题得分率 90.85%,数学拖了后腿 2026.9.22-第15张图片-四季读书网

读法:门槛提到 0.90,63% 的题可以全自动处理,且准确率 99.68%;剩下 37% 交人工。

这个收益曲线形状很好——用 37% 的人工量,把整体准确率从 90.85% 拉到 99.68%

七、但它也会错得很自信

前面一直在说它"偏保守"。但保守不等于不会错,而且有些错误相当危险。

137 道错题里:

Jev 高考实测:1497 道单选题得分率 90.85%,数学拖了后腿 2026.9.22-第16张图片-四季读书网

60 道错题是在"有把握"的情况下答错的。 最典型的 10 道:

Jev 高考实测:1497 道单选题得分率 90.85%,数学拖了后腿 2026.9.22-第17张图片-四季读书网

看最后两列的对比——它给错误答案 0.96 的概率,给正确答案只有 0.03。这不是"犹豫着选错",是"笃定地选错"。

其中有 2 道,正确项的概率直接是 0.000——它压根没把正确答案当成候选。

所以结论很明确:置信度可以用来筛掉"明显没把握"的题,但不能当作正确性的保证。 高风险场景必须留人工兜底,或者加第二重校验。

八、错在哪:错题分布与选项偏好

137 道错题的学科分布极不均匀

Jev 高考实测:1497 道单选题得分率 90.85%,数学拖了后腿 2026.9.22-第18张图片-四季读书网

光数学两科就占了全部错题的 51.8%。 而政治考了 316 道题(全场最多),错误率只有 2.85%。

还有个常见担心:它会不会偏爱某个选项?(比如总是选 B)

我算了完整的混淆矩阵:

Jev 高考实测:1497 道单选题得分率 90.85%,数学拖了后腿 2026.9.22-第19张图片-四季读书网

图 6 混淆矩阵(行归一化,单位 %)

Jev 高考实测:1497 道单选题得分率 90.85%,数学拖了后腿 2026.9.22-第20张图片-四季读书网

对角线强,非对角线弱——答案是啥它基本就选啥。

它的选择分布也很均衡:A 371 次、B 398 次、C 393 次、D 335 次(正确答案本身是 A 343、B 401、C 407、D 346)。没有明显的选项位置偏好

有意思的是,A 的召回率最高(94.75%),D 最低(88.44%)——差 6 个百分点。这个偏好在别的题库上是否稳定,得再测。

九、速度与成本

Jev 高考实测:1497 道单选题得分率 90.85%,数学拖了后腿 2026.9.22-第21张图片-四季读书网

题干长度和耗时的相关系数只有 -0.026——几乎不相关。也就是说它不会因为题目长就明显变慢,响应时间是稳定的。

全部 1497 道题跑完,20.6 分钟,三分钱。

十、结论

能用的部分:

Jev 高考实测:1497 道单选题得分率 90.85%,数学拖了后腿 2026.9.22-第22张图片-四季读书网

三条使用建议:

  1. 按学科分配信任度
    。政治、生物、英语这类记忆型学科可以直接上;数学类必须加倍抽查。
  2. 置信度是筛子,不是保证
    。它能帮你把明显没把握的挑出来,但高置信里仍有错误。
  3. 高风险场景必须兜底
    。哪怕 99% 准确率,落到具体业务上,那 1% 是哪个题、错得多严重,比平均值重要得多。

最后说说这份测评的边界(很重要):

  • 高考题是公开数据,模型训练语料很可能覆盖过。所以 90.85% 只能说明"在这个题集上的表现",不能证明"具备可迁移的推理能力"。真想验证,得用没公开过的题。
  • 跟 GAOKAO-Bench 官方给的 GPT-4 基线(客观题 72.2%)口径不同,不能直接比。官方题库包含题组型,且评测走的是"生成+规则抽取",会有解析损耗。
  • 结果是特定时间点的快照(Jev 版本 jev-1.13.0)。这类服务常用 latest 别名,版本会漂移,复现时要锁版本号。

附:数据与代码(可复现)

这篇文章里的每一个数字都能复现,全部东西我放在 GitHub 上了:

github.com/kuaitoukuai/jev-gaokao-eval

仓库里有什么:

Jev 高考实测:1497 道单选题得分率 90.85%,数学拖了后腿 2026.9.22-第23张图片-四季读书网

题库来自 GAOKAO-Bench(上海交大 OpenLMLab 开源,Apache-2.0 许可): github.com/OpenLMLab/GAOKAO-Bench


本文数据全部来自 1497 道题的逐题实测,无模拟值。

抱歉,评论功能暂时关闭!