20个省份、千万级考生、±1次容差,以及三个至今没有公开的数字
引言
问题已经进入成绩生成链条
AI视觉判分已经进入体育中考的成绩生成链条,并且直接参与升学分数的形成。按厂商口径,规模已经到了20个省份、累计千万级考生。
公开的东西很多:设备参数、判罚规则、容差范围、考务效率的提升幅度。缺的是三个数字:首次测试的无结果率与重测率,AI判定与人工复核的一致率与改判率,以及临界分数附近的误差分布。这三项在采购文件、政府报道、厂商材料和上市公司年报里都找不到。
更值得注意的是方向性问题。现有同行评议研究报告的准确率在体能较弱的受试者身上明显更低,而分数线附近恰恰是体能较弱学生最密集的位置。识别误差和升学风险落在同一批人身上。
这里想说明:当视觉测评只服务体育课,误差影响的是训练反馈的质量。当同一类设备进入升学成绩的生成链条,需要接受检验的对象就从设备参数扩展到算法效度、失败样本、分组表现和申诉机制。目前公开的是前者,缺的是后者。
AI体考已经进入规模化运行
规模已经越过试点阶段
先看规模。
恒鸿达(福建)体育科技称,截至2026年其AI体育中考解决方案覆盖全国20个省份,累计为近1000万考生提供考试技术服务,AI体育中考市占率行业第一,已连续六年。同一家公司还称智慧操场落地31省、阳光跑落地11省、AI军事训练场覆盖15省部队训考场景,累计服务3680余所学校。
这组数字的演变过程本身值得看一眼。该公司较早的页面写的是服务全国15个省份、超200万名考生;中期口径为覆盖16省、累计550万名中考考生、3180所学校;现在是20省、近1000万、3680余所学校。三年之内,覆盖省份增加5个,考生口径增加约5倍。这类自报数字没有第三方核验渠道,引用时需要按宣传材料对待。
参与方不止一家。格灵深瞳2024年参与京津冀多个区县的体育中考,共11场考试,覆盖考生近5万人,总考核次数超18万人次;其中北京的体育中考由该公司AI视觉技术支撑的项目覆盖除游泳外的全部21项,河北实现全部覆盖。科大讯飞智慧体育解决方案已应用于安徽、山东、河南、内蒙古、河北、陕西等省份的20余个市县区。融梦跃视(上海)体育科技称截至2026年3月31日,其智慧终端已在全国6852所院校部署28606台设备,覆盖33个省级行政区。
2026年的实际落地案例足够密集,可以确认这不是纸面规划。
哈尔滨2026年中考体育改革落地,总分提至80分计入初中学业水平考试总成绩,其中统一测试50分,分三大类共11个项目,所有项目均布置AI体测终端。1000米(男)、800米(女)在标准400米跑道场内布置AI体测终端,考生面向终端完成人脸识别后进入候考区,跑道次由电脑随机排序,AI终端发出模拟发令枪响后开始计时,抢跑一次警告、两次取消成绩,每组最多15人。引体向上以下颏超过横杠上缘为完成一次,动作间隔超过10秒自动停止。立定跳远由AI摄像头捕捉起跳瞬间,自动判定是否踩线并测量落点距离。
同年,南昌37622名考生在半天内完成所有项目考试;宿迁24600名考生实现核心项目全面AI覆盖;南平约3万名初中毕业生参加考试,引体向上、斜身引体、排球对墙垫球全部由传统光电计数升级为AI影像辅助判罚系统,此前2025年该市已在仰卧起坐项目引入AI辅助监考。开封市政府报道称,2025年市区中招体育考试已使用无穿戴式AI智能采集设备,考试结束后成绩直接显示,并保留视频异议复核。

到这个体量,把它当成设备采购新闻已经不合适。这是一套全国性的考试基础设施。
成绩生成链条与效度缺口
AI判分直接进入升学成绩
规模只是前提。真正把这件事的性质改变的,是分数的用途。
已核实的官方文件里,最完整的一条链在河南林州。当地2026年体育考试服务采购文件把逻辑写全了:考试分七、八年级过程性评价30分与九年级终结性评价70分;50米、800/1000米、引体向上、仰卧起坐等项目要求"摄像头视觉识别、AI自动判断";50米、引体向上、仰卧起坐原则上只有一次机会;跑步允许误差±1.5%,计数项目通常±1次;全程视频留存,支持视频仲裁、成绩比对和修正。当地体育考试满分100分,计入730分的中招总分。
需要保留一个事实边界:该项目的正式成交公告和实施报道目前检索不到。这份文件能证明当地已经把视觉AI写进升学考试的采购与判分制度,还不能证明这套具体设备完成了2026年的考试。
其他几个已核实的官方样本:
地区:河南林州
体育分值:100分
计入方式:730分中招总分
AI覆盖范围:50米、长跑、引体向上、仰卧起坐
关键约束:三项原则上一次机会;±1.5% / ±1次
地区:北京经开区
体育分值:见下方注
计入方式:过程性成绩与现场考试合并计入
AI覆盖范围:AI智能仪器设备加人工复核
关键约束:成绩录入后禁止改动;项目覆盖约12815名四、六、八、九年级考生
地区:广东吴川
体育分值:100分
计入方式:按80%折算计入高中录取总分
AI覆盖范围:仰卧起坐等,一名考生对应一台算力摄像头
关键约束:自动识别五类犯规;计数误差±1次;长跑用RFID而非视觉
地区:福建长乐
体育分值:40分
计入方式:800分中考投档总分
AI覆盖范围:长跑、50米、引体向上等
关键约束:采购文件称用于"替代人工考试";约8800名初中毕业生
地区:黑龙江哈尔滨
体育分值:80分
计入方式:学业水平考试总成绩
AI覆盖范围:11项全部布置AI终端
关键约束:AI发令;抢跑两次取消成绩
(注:北京体育与健康的中考分值处于改革过程中,公开材料对不同年份的表述存在差异,本文暂不给具体数字,发稿前需以市教育部门当年度文件为准。)
仅吴川和长乐两个项目的采购说明就涉及约23358名毕业考生,北京经开区项目另覆盖12815名四至九年级考生,其中升学相关年级人数未单列。这些项目多由区县统一采购,公告通常不列学校清单,所以"覆盖多少所学校"这个问法在现阶段没有答案。
把这些约束放在一起,结构就清楚了:单次测试机会 + 自动判分 + 计入升学 + 成绩录入后禁止改动。一次算法输出直接生成一个基本不可撤销的分数。

同时要看到,日常教学端的产品线在并行扩张:东北师范大学168.8万元项目同时设置随堂测试、国家体测和自由练习;闽侯县实验小学29万元项目覆盖体育课、日常训练、国家体测和课后锻炼。训练设备和判分设备是两条同时长大的业务线,但它们面对的验证要求应当不同。
考务效率与判分效度是两套指标
现在问一个直接的问题:这些系统判得准不准,有公开数据吗?
厂商反复提供的是另一类数字。格灵深瞳的材料称,引入视觉AI后单天考试人数最高达2500人,单天平均考试时长比往年缩短约三分之一,部分考场裁判人数比往年减少60%以上;基于视频回溯能力,裁判面对学生申请仲裁时有据可依,考试中的争议和申诉比例大幅降低。该公司创始人赵勇在受访时表示,过去几万名考生背后有几千个教练,每个人的标准都不一样,会产生不公平和争议,公司基于上千个教练的共同认知训练出一个统一算法,每个孩子都用同一个判断标准判分。
这些都是考务效率与流程指标。裁判人数、单日容量、考试时长,都是真实的收益,也确实回应了传统人工考试的痛点。但它们不能回答判分是否准确。
"争议和申诉比例大幅降低"这一条尤其需要拆开看,因为它至少有两种解释:
第一种,系统判得比人工更准,所以可争议的空间变小了。
第二种,考生和家长失去了申诉的依据。人工判分时,考生看得见裁判,能当场对一次动作是否算数提出异议。改成算法判分后,异议对象变成一个考生无法审查的判定过程,视频回放只能证明动作发生过,无法证明算法的计数规则在这一次动作上是否被正确执行。申诉率下降在这种情况下同样成立。

现有公开数据无法区分这两种解释。区分它们需要的正是本文开头列出的三个数字:
- 首次测试的无结果率与重测率。
有多少考生的首次测试因为识别失败、遮挡、光照、服装或设备原因没有产生有效成绩,需要重测。在只有一次机会的项目上,这个数字直接对应分数损失。 - AI判定与人工复核的一致率与改判率。
多份文件都写了"AI设备加人工复核"或"支持视频仲裁",那么复核实际受理了多少例,改判了多少例,改判方向是升还是降。 - 临界分数附近的误差分布,以及分组表现。
不同身高、体型、服装、肤色和光照条件下的表现差异;犯规动作的漏判率与误判率;软件升级后是否重新验证。
这些数字采集成本很低,因为系统本身就在记录全过程视频和结构化成绩数据。它们没有被公开,目前也看不到公开的制度要求。

同行评议研究中的准确率与分组差异
任务相近的同行评议研究给出的数字,和宣传口径有明显距离。
2025年一项发表在传感器领域期刊的实验研究,将算法计数与经验丰富的人工评估者记录的真实有效次数对比,报告引体向上识别准确率96.6%、俯卧撑97.4%。这个数字看起来很高。但同一篇论文里有一句更重要的话:该评估算法在体能水平较高的受试者身上准确率相对更高。对应到分组数据,普通学生组的引体向上识别是16/18,即88.9%。论文同时明确了实验条件:一台摄像机对应一人,遮挡和光照不良会造成关键点"飞点"。
2024年另一项姿态估计计数研究,在20名测试者中报告平均计数准确率92%到94%,不同场景区间为88%到96%;实验明确限制没有其他人遮挡;去掉帧间隔优化后,完整模型准确率从94%降至78%。
本文认为最值得注意的推论是方向,而不是水平。 报告的准确率在体能较弱的受试者身上更低。而分数线附近,尤其是引体向上从0次到1次、仰卧起坐从及格线上下这些位置,集中的正是体能较弱的学生。识别误差最大的人群,与最容易因为一次误判而跨越分数档位的人群,是同一批人
不过这里有两条边界。
第一,论文准确率和采购容差是两个不同的指标,不能互相印证也不能互相反驳。前者是特定小样本条件下的动作识别表现,后者是器材验收的容差要求。吴川采购要求"一名考生对应一台算力摄像头",和上述论文的实验条件"一台摄像机对应一人"确实可以形成对照,但这只说明采购方注意到了同一个约束,不能说明该产品在真实考场达到了论文报告的水平。
第二,人工判分的一致性同样不高。一项对FITNESSGRAM与PHYSICAL BEST两套人工测试方案的比较研究显示,仰卧起坐与curl-up的判定结果在男生中一致率72.2%(Kappa=0.368),女生64.4%(Kappa=0.130);引体向上与改良引体向上在男生中一致率47.2%(Kappa=0.071),女生44.5%(Kappa=0.102)。也就是说,"完成一次算不算数"这件事的分歧,在AI进场之前就存在于协议定义层面。
问题不在于摄像头比人眼更可靠还是更不可靠,而在于一个判定规则被固化进算法、批量应用到千万考生、并直接生成升学分数之后,这个规则的效度有没有被公开验证过。人工判分的不一致是分散的、可当场质疑的;算法判分的偏差是系统性的、一致地作用于所有考生的。后者的验证要求本应更高。
产业链、标准与验证责任
提供方的财务结构与验证激励
这条链上有一家上市公司,所以有审计数据可查。
格灵深瞳(688207.SH)2025年年度报告摘要显示:全年营业收入15546.67万元,同比增长32.61%;归属于上市公司股东的净利润-18636.75万元,扣除非经常性损益后-20046.69万元;经营活动产生的现金流量净额-21348.28万元;研发投入占营业收入比例93.93%(2024年为161.18%,2023年为70.14%);母公司财务报表累计未分配利润-50747.09万元;2025年度不派发现金红利、不送红股、不以资本公积金转增股本。审计机构中兴华会计师事务所出具标准无保留意见。
分季度看,2025年四个季度营业收入分别为767.47万元、3479.81万元、5175.61万元、6123.78万元,全年集中在下半年。
年报摘要把智慧教育列为公司四大应用领域之一,业务描述为:智慧体育解决方案主要针对普教、高教、部队训考场景,基于自研三维视觉识别技术,结合动作模型库和人体运动功能学,可实现学生日常训练与体育考核的过程记录分析、成绩自动评判、数据自动统计汇总分析等功能。
这里出现了本文在核实过程中最意外的一点:年报摘要没有单列智慧教育的分部收入。
可查到的分部数字来自公司发布年报时的对外口径:城市管理领域2025年营收4227万元、同比上涨30%;政务及特种领域营收9269万元、同比上涨507%。这两项合计约1.35亿元,占15546.67万元总营收的约87%。据此,智慧金融与智慧教育两个领域2025年的收入合计约2050.67万元。考虑到智慧金融仍是公司两大战略赛道之一、且农业银行仍在客户名单内,智慧教育的实际收入是这2050.67万元中的一部分。
同期公司毛利率33.41%,同比下降19.08个百分点,公司给出的归因中包括城市管理、政务及特种、智慧教育等领域尚处市场开拓初期、项目前期投入较高、标准化产品仍在爬坡,叠加收入结构中硬件产品占比提升。
把这些放在一起,结构就出来了:一项已经在北京承担了除游泳外全部21个中考项目判分的技术,在提供方的收入表上是一条尚在爬坡、硬件占比高、拉低整体毛利率、且未被单独披露的创新业务线;提供方全年亏损1.86亿元,经营性现金流出2.13亿元,研发投入接近营业收入本身。
这个落差本身不构成对产品质量的指控。但它说明了一件事:验证成本由谁承担这个问题没有答案。一家承受这种财务压力的公司,没有商业动机自己去做一份可能显示自家产品在弱体能学生身上准确率更低的第三方效度研究。采购方是区县教育部门,按考生人数计价,验收依据是设备参数。链条上没有任何一方的利益指向"公开判分效度数据"。
采购侧的分工也加深了这一点。姚安县第一中学项目以85.972万元中标,中标方是中移建设,核心体育教学终端品牌为安徽一视。拿项目的系统集成商、做安装运维的服务方和提供底层算法设备的科技公司常常不是同一家,出现效度争议时,责任主体的界定并不清晰。
采购模板与国家标准的时间差
林州2026年3月的采购文件仍要求检验报告符合GB/T 19851.12—2005;国家标准平台显示该版本已于2026年2月1日废止,由GB/T 19851.12—2025全部替代。
这不能推导出采购违法。它说明的是部分采购技术模板没有跟上标准更新,模板复用的惯性大于对标准状态的核查。
更值得追问的是下一层问题:GB/T 19851.12—2025的正文是否对视觉AI判分设备提出了效度或验证条款。如果新版国标只规范器材的物理与计量指标,那么这类以算法输出为核心的判分设备,目前是在什么标准下被验收的。这个问题本文没有查到答案,需要查国标正文才能回答,本文暂列为待核。
满分率变化与可检验的预测
以下是假设与预测,不是结论。
恒鸿达的材料称,在应用其AI智慧体育应用后,福州市中考体育满分率从2022年的12%提升至2025年的30.7%,并将其作为提升学生体育成绩与身体素质的成效证明。该公司2022年中标福州市体育中考AI考试服务,福州是它的起点市场。
可交叉核对的官方数字是:2025年福州中考体育平均分32.73分,满分40分,由市教育局公布,完全免考组考生按全市平均分计分。
三年内满分率接近翻三倍,至少有三种竞争解释同时成立:
解释一,学生体质确实提升。 体育中考分值提高、社会重视程度上升、日常训练增加,都会推高成绩。
解释二,判定口径发生了变化。 AI计数对"完成一次"的判定与人工裁判并不必然等价。前一节引用的人工方案比较研究显示,仰卧起坐类项目的判定一致率只有六到七成。如果算法的阈值设置比人工裁判更宽松,满分率会上升,而这与体质无关。
解释三,考试项目组合变化。 福州体育中考的抽选考项目每年摇号确定。2025年是2021年全省统一中考以来福州第一次抽中1分钟跳绳。跳绳与引体向上的满分难度显著不同,项目组合变化本身足以造成满分率的台阶式跳升。
现有公开数据无法区分这三种解释。但可以给出一个可检验的预测:
如果满分率跃升主要由判定口径变化驱动,那么在项目组合不变的相邻年份之间也会出现台阶式跳升,且跳升集中在计数类项目(引体向上、仰卧起坐、跳绳)而非计时类项目(50米、长跑)。反之,如果主要由体质提升驱动,则各项目应呈现相对平缓且同向的改善。
这个预测可以用各地逐年的分项成绩分布数据检验,前提是教育部门公布分项分布。目前多数地区只公布平均分或总分分布。
把公平变成可检验的事实
三项可以直接公开的数据
体育中考引入AI的两个核心承诺是效率和公平。效率已经被证明:单日容量、考试时长、裁判人数,都有可查的改善。公平这一半目前只有承诺,没有数据。
要把它从宣传变成可核验的事实,成本很低。教育部门在公布年度体育中考方案的同时,同步公布三项数据即可:
首次测试的无结果率与重测人数; 人工复核受理数、改判数与改判方向; 分项成绩分布,按项目和年份可比。
这三项数据系统本身已经在采集。不公布的成本是零,公布的成本也接近零。真正的差别在于,公布之后,"AI让考试更公平"这句话就变成了一个可以被检验、也可以被反驳的陈述。
一项已经参与千万人升学分数生成的技术,应该到了接受这种检验的阶段。

欢迎体育人共建AI Agent生态

智体研团队正在招募实习生,方向包括科研与产品两类,研究领域聚焦动作捕捉以及相关的人体运动分析与建模。
科研方向偏算法与数据,主要参与运动信号处理、步态与姿态建模等工作,具体内容会结合个人背景与项目需求安排。产品方向偏落地,关注相关技术如何转化为可用的产品形态,参与需求调研、原型搭建与迭代推进。
我们希望你对动作捕捉、可穿戴或运动健康领域有真实兴趣,愿意动手。有信号处理、机器学习、运动科学或人机交互相关基础者优先,基础一般但学习意愿强的同学也欢迎沟通。时间上,希望每周能保证若干天稳定到岗。
工作地点为上海,待遇面议。有意者请将简历发送至,并简要说明意向方向与个人兴趣。