从一个托福模拟考试网页,我重新理解了AI时代的“能力系统”

四季读书网 2 0
从一个托福模拟考试网页,我重新理解了AI时代的“能力系统”
从一个托福模拟考试网页,我重新理解了AI时代的“能力系统”-第1张图片-四季读书网
前两天,我原本只是想解决一个很具体的问题:
托福考试的形式变了,需要通过模拟考试训练更好地熟悉新的考试。
我找到了一套ETS发布的新版TOEFL iBT Practice Test。
这套练习已经按照2026年1月21日之后的新版考试进行了调整,阅读、听力、写作和口语的题型都发生了变化。

阅读增加了Complete the Words和日常阅读材料

写作包括Build a Sentence、Write an Email和Academic Discussion

口语则包括Listen and Repeat和Take an Interview

ETS同时说明,这套材料为了纸面使用对考试进行了适配,并不是实际数字化考试的完整复刻。
于是我产生了一个很自然的想法:
能不能自己做一个更接近真实考试环境的模拟考试网页?
最开始,我以为这只是一次很普通的AI应用:我提出需求,AI帮我做网页。
但随着这个网页不断完善,我突然发现,我真正做出来的东西已经不是一个简单的“AI工具”。
它开始成为一个由人、AI和信息系统共同组成,围绕“提高托福成绩”这一现实目标持续运行的系统。
而这个过程,也让我重新理解了过去一直在研究的一个问题:

企业里的组织能力系统,也许只是一个更普遍的“能力系统”进入企业之后的特殊形态。

从一个托福模拟考试网页,我重新理解了AI时代的“能力系统”-第2张图片-四季读书网

一、最开始,我只是想模拟一次真正的托福考试

纸面的托福练习材料当然可以做题。
但是备考时,我想知道的不只是“这些题我会不会做”,还包括另一个问题:
如果真正坐在托福考试的电脑前,我能不能适应它的考试方式?
于是第一版网页的目标非常简单:尽可能模拟新版TOEFL的考试过程。
  • 阅读和听力按照考试模块组织;
  • 不同部分设置时间限制;
  • 听力按照真实考试逻辑只能播放一次;
  • 口语可以直接录音;
  • 写作在规定时间内完成;
  • 考试结束后自动提交。
随着模拟程度不断提高,又加入了阅读和听力的自适应逻辑、四科成绩、CEFR水平以及0—120分的估算结果。
做到这里,它已经比一份PDF练习材料方便很多。
但本质上,它仍然只是一个考试工具
因为它只解决了一个问题:

让我完成一次比较真实的模拟考试。

真正改变我对这个系统理解的,是第一次真正做完考试以后。

二、做完一次考试以后,我才发现“分数”远远不够

考试结束后,我碰到了一个很现实的问题:
我做完了,却没有完整记住自己每道题究竟选了什么。
这让我意识到,如果一个模拟考试系统最后只告诉我一个总分,那么它真正提供的价值其实非常有限。
因为对于备考来说,真正重要的问题根本不是:这一次考了多少分?
而是:我为什么只有这个分数:
  • 哪些题做错了?
  • 为什么错?
  • 哪些单词不认识?
  • 阅读、听力、写作、口语分别存在什么问题?
  • 哪些问题只是偶然失误?
  • 哪些问题已经反复出现?
  • 接下来应该重点学什么?
  • 下一次考试又应该怎样判断自己究竟有没有进步?
到了这一步,我的需求已经发生了变化。
我不再只是想拥有一个“能够考试的网页”。
我要的是:
通过考试发现问题,再利用这些问题帮助我继续学习。
于是系统开始从“考试”向“学习”延伸。

三、错题集首先让一次考试产生了“记忆”

最先需要解决的,是错题。
如果一道题做错以后,我看一眼答案,然后进入下一次考试,那么这次错误几乎没有留下什么价值。
所以后来我在系统里增加了错题集
阅读和听力中的客观题,只要做错或者没有作答,就会在考试结束后进入错题集。
但错题集记录的并不只是:“第几题错了,正确答案是什么。”
它还可以保留:
  • 题目材料;
  • 选项;
  • 我的答案;
  • 正确答案;
  • 错误解析;
  • 暴露出来的知识和能力缺口;
  • 后续学习建议。
如果以后再次遇到同一个问题,系统还可以记录重复出现的次数。
这样一来,错题的意义就发生了变化。
一道错题不再只是一次考试中的失败结果。
它开始成为一条可以被长期积累的数据。
如果同一种错误不断出现,系统就有可能逐渐发现:

这不是偶然做错了一道题,而是某一种能力存在稳定的问题。

例如,可能不是这一道阅读题没有看懂,而是主旨判断长期比较弱;
不是偶然漏掉一句听力,而是在特定类型的信息提取上持续出现问题。
这时候,“错题”开始转化成了“能力诊断”的输入。

四、生词表把“这次没看懂”变成了下一次要解决的问题

词汇也有同样的问题。
在过去的做题过程中,遇到一个生词,我可能临时查一下,也可能干脆根据上下文猜过去。
考试结束以后,这个词很可能就消失了。
下一次遇到,我仍然不认识。
所以后来我又给系统加入生词收集机制
但这里又出现了一个很有意思的设计问题。
模拟考试期间,如果我一碰到不会的单词就能立即看到中文解释、音标和例句,那么考试本身就失真了。
因此,考试过程中只能把一个词标记为“本场单词”。
它只负责记录这个词我不会,不能马上告诉我中文。
等到考试提交以后,这些词才进入个人的生词表
在生词表里,可以进一步看到音标、发音、中文释义、例句以及它来自哪一道题、哪一段材料。
如果以后再次遇到同一个词,也可以继续累计出现次数。
这个很小的机制实际上非常重要。
因为它把两个阶段分开了:

考试阶段负责真实暴露问题,学习阶段负责解决问题。

考试不是为了边做边获得帮助,而是为了尽可能准确地发现自己究竟会什么、不会什么。
而考试中暴露出来的问题,也不会随着考试结束消失。
它们进入了下一轮学习。

五、基础词库和个人生词表,解决的其实是两个完全不同的问题

后来我又加入了一个基础词库。
一开始,这看起来只是生词表之外又多了一个背单词功能。
但仔细想,两者其实承担着完全不同的任务。
基础词库回答的是:托福备考通常需要掌握什么。
个人生词表回答的是:这些词里面,我具体不会什么。
前者是相对通用的学习内容。
后者是根据个人真实表现不断形成的学习内容。
因此,基础词库也不能只是一个固定的静态词表。
随着后续做题,如果系统不断发现新的托福常用词汇,也可以继续补充进基础词库。
而个人生词表则随着每个人的实际考试和练习持续变化。
这意味着学习内容开始出现两个来源:
一部分来自通用知识体系
另一部分来自个人真实问题
这也是一个完整学习系统非常重要的特征。
真正有效的学习从来不能只靠统一教材,也不能只靠临时查缺补漏。
它需要把两者结合起来。

六、成绩只是结果,真正重要的是把结果转化成能力诊断

随着考试数据越来越完整,我又开始意识到:
即使有总分、有错题、有生词,也仍然不够。
因为这些都只是零散的信息。
真正对备考有价值的,是进一步回答:

这些结果说明我的能力结构是什么?

所以在考试结束以后,系统开始提供的不再只是一个数字。
它还要分析四科表现,形成能力地图,解释主要问题,并给出下一步训练建议。
这一步意味着系统开始从“记录结果”走向“解释结果”。
同样是80分,两个人的问题可能完全不同。
一个人可能阅读很好,但听力严重拖后腿;
另一个人四科都比较平均,但整体词汇和语言熟练度不足。
即使阅读错了同样数量的题,原因也可能不同。
  • 有人是词汇问题;
  • 有人是句子结构理解问题;
  • 有人是推理问题;
  • 有人则是时间分配问题。
所以真正有价值的不是简单地告诉学习者:你错了多少题。
而是进一步判断:这些错误组合在一起,意味着什么。
到了这里,AI的价值开始真正显现出来。
因为把大量分散的考试记录、错题、生词和作答情况转化成对学习者能力的判断,本身就是一个认知分析过程。

七、但“知道问题”仍然不等于能够提高成绩

做到能力诊断以后,系统看起来已经很完整了。
但继续往下想,又会发现还有一个巨大的缺口。
假设系统已经告诉我:
  • 阅读某种题型比较弱;
  • 听力信息提取存在问题;
  • 词汇量需要加强;
  • 写作某些结构不熟练。
然后呢?
如果诊断停在这里,它依然只是一个更高级的分析工具。
真正的备考最终一定要落到:明天开始,我究竟应该做什么?
所以又需要加入备考计划
考试成绩、能力诊断、错题和生词都应该继续向下转化:
  • 哪些错题需要复习;
  • 哪些生词需要反复学习;
  • 哪个题型需要专项练习;
  • 四科的学习时间怎样安排;
  • 当前阶段最重要的突破点是什么;
  • 下一次模拟考试应该安排在什么时候;
  • 到下一次考试时重点验证什么。
这样,“发现问题”才真正转化成“解决问题”。

八、这时候,一个完整的学习闭环才真正出现

回过头来看,这个网页已经经历了一个非常明显的变化过程。
最开始,它只是:

模拟考试。

后来增加成绩:

模拟考试 → 结果。

再后来加入错题、生词和能力分析:

模拟考试 → 记录 → 诊断。

再加入基础词库、个人生词表、错题复习和备考计划:

模拟考试 → 记录 → 诊断 → 学习 → 训练。

最后还要再次考试:

模拟考试 → 记录 → 诊断 → 学习 → 训练 → 再测试。

新的考试结果又会重新进入下一轮:

再记录 → 再诊断 → 再调整。

到了这里,我突然意识到:
我做的已经不是一个托福考试网页。
它实际上正在形成一个完整的循环:
测试 → 记录 → 诊断 → 学习 → 训练 → 再测试 → 根据结果继续调整
这已经是一套围绕“提高托福成绩”这个现实目标持续运行的学习能力系统

九、更重要的是,能力并不来自单一主体

仔细分析这个系统,还会发现一个非常有意思的地方:
真正产生学习结果的,并不是其中任何一个单独主体。
1、人负责目标、感知和判断
是我决定要达到什么托福成绩。
是我在真正使用系统以后发现:
  • 仅仅有考试不够;
  • 只有总分不够;
  • 生词需要留下来;
  • 错题需要积累;
  • 诊断以后还需要计划。
AI可以提出方案,但什么问题值得解决、结果是不是我真正需要的,最终仍然需要人判断。
同时,真正参加考试、完成学习和承担结果的也是人。
2、AI负责大量认知工作
  • AI可以理解新版托福考试结构;
  • 生成和组织试题;
  • 分析作答结果;
  • 解释错题;
  • 整理生词;
  • 识别重复出现的问题;
  • 判断薄弱环节;
  • 提出训练建议;
  • 根据能力情况形成备考计划。
这些过去往往需要教师、题库开发者、学习顾问、内容编辑甚至程序员分别完成的工作,现在可以被AI大量承接。
3、信息系统负责把能力稳定下来
网页扮演了信息系统的角色,承担的是另一种能力:
  • 组织考试流程;
  • 执行计时和考试规则;
  • 记录每一次答案;
  • 保存成绩;
  • 保存错题;
  • 保存生词;
  • 管理基础词库;
  • 保存历史数据;
  • 把考试、分析、学习和训练连接起来。
AI可以每次重新回答一个问题。
但如果没有信息系统,很多东西仍然只是一次对话。
正是信息系统把这些能力固定下来,使它们可以反复运行和持续积累。
所以最终形成能力的,并不是人,也不是AI,更不是一个网页。
而是三者围绕同一个目标形成的分工和协作。

十、这让我重新理解了过去一直研究的“组织能力系统”

过去一段时间,我一直在研究企业AI转型。
其中一个核心判断是:

企业真正需要的,不是简单部署AI工具,而是围绕企业要持续解决的问题,把人的能力、AI能力和信息系统能力重新组合起来,形成组织能力系统。

比如一个企业想持续提升销售转化率。
真正需要建设的不是一个销售AI助手。
而是重新设计:
  • 哪些事情由销售人员完成;
  • 哪些分析交给AI;
  • 哪些流程由信息系统执行;
  • 客户信息如何沉淀;
  • 销售经验怎样进入知识库;
  • 结果怎样记录;
  • 绩效怎样评价;
  • 问题怎样反馈;
  • 下一轮怎样继续改进。
过去我把这种结构称为:
组织能力系统。
因为我的研究对象一直是企业。
但做完这个托福备考系统以后,我突然产生了一个问题:

为什么一定要进入企业,才能形成这样的系统?

托福学习显然不是一个企业管理问题。
这里没有部门、没有组织架构、没有岗位体系、没有绩效制度、也没有公司治理。
但它同样存在目标、问题、任务、数据、知识、规则、人的判断、AI的认知、信息系统的执行、结果反馈、持续改进。
底层运行机制几乎完全一致。
这意味着:
组织能力系统之上还存在一个更普遍的概念。
我把它称为:

能力系统。


十一、什么是“能力系统”?

我现在倾向于这样定义它:

能力系统,是围绕现实中的某类问题或需求,结合人的感知与影响能力,AI的分析和洞察能力以及信息系统的协同和执行能力,形成能够持续完成同类任务、稳定产生预期结果,并根据结果反馈不断调整和进化的系统。

这里最重要的不是“人+AI+信息系统”同时出现。
三个东西放在一起,并不会自动形成能力系统。
真正关键的是几个条件:
  • 必须围绕一个相对稳定的现实问题或目标;
  • 必须能够把问题转化成可以持续执行的任务;
  • 人、AI和信息系统之间需要形成分工;
  • 任务执行以后需要产生可以观察的结果;
  • 结果需要被记录下来;
  • 系统能够根据结果重新发现问题;
  • 最后还能继续调整下一轮行动。
所以我现在越来越倾向于用一句话区分两种完全不同的AI应用:

一次完成任务,是能力调用;持续解决一类问题,才可能形成能力系统。

问AI一次单词是什么意思,是能力调用。
让AI生成一篇文章,也是能力调用。
让AI临时分析一次考试成绩,仍然可能只是能力调用。
如果考试不断产生数据,数据进入错题集和生词表,AI继续完成诊断,诊断形成学习计划,系统继续组织训练,再通过下一次考试验证结果。
能力就已经开始被系统化。

十二、能力系统不是Agent,它们解决的是两个层次的问题

讲到这里,一个很自然的问题是:

这套能力系统,不就是现在大家都在讲的Agent吗?

答案是否定的。
Agent当然可以成为能力系统中非常重要的一部分,但两者解决的并不是同一个层次的问题。
如果简单概括:

Agent关注的是:AI怎样更自主地完成任务。

而能力系统关注的是:

围绕一个现实目标,怎样把一类问题持续解决好。

Agent相比传统的一问一答式AI,一个非常重要的变化,是AI可以围绕一个目标自行规划步骤、调用工具、执行任务,并根据中间结果继续决定下一步行动。
例如,在这套托福系统里,未来完全可以加入一个“托福备考Agent”。
  • 它可以读取我的考试成绩、错题和生词;
  • 分析我的薄弱环节;
  • 自动生成下一阶段练习;
  • 制定一周备考计划;
  • 批改写作;
  • 评价口语;
  • 根据新的考试结果继续调整学习任务。
这样的Agent当然非常有价值。
但是,即使这些事情都实现了,Agent仍然不等于整个托福备考能力系统。
因为提高托福成绩并不是Agent自己可以完成的。
真正的学习者仍然要确定自己的目标,投入学习时间,完成练习,判断AI的建议是否合理,并最终走进考场承担考试结果。
信息系统也仍然不可缺少:
  • 历次考试成绩需要保存;
  • 错题需要长期积累;
  • 生词需要持续更新;
  • 学习计划需要记录执行情况;
  • 历史结果需要比较;
  • 下一次考试还需要继续产生新的数据。
如果这些东西每完成一次Agent任务就重新开始,那么Agent即使非常聪明,也没有形成一套真正能够持续运行的学习能力。
因此,两者最核心的区别在于:
Agent
能力系统
核心问题
AI怎样自主完成任务
怎样持续解决一类现实问题
关注重点
任务规划、工具调用与执行
人、AI、信息系统的能力组合与持续运行
主要主体
AI
人、AI和信息系统
时间尺度
一次任务或一段连续任务
长期反复解决同一类问题
人的角色
用户、监督者或协作者
目标、判断、行动和责任主体
信息积累
可以拥有记忆
必须形成持续的数据和知识沉淀
终结果
把任务完成
持续、稳定地产生预期结果并不断改进
所以更准确地说:

Agent是一种AI技术形态,能力系统是一种问题解决体系。

一个能力系统中可以没有严格意义上的Agent,只是在不同环节调用普通AI。
也可以拥有一个Agent。
还可以有多个Agent,分别负责出题、诊断、学习规划、写作批改和口语评价。
决定它是不是能力系统的,并不是拥有多少Agent,而是:
  • 这些能力有没有围绕现实目标形成合理分工;
  • 运行结果有没有沉淀;
  • 问题能不能被重新发现;
  • 下一轮行动能不能因此调整;
  • 整个体系能不能越来越好地解决同一类问题。
所以,一个非常强大的Agent,如果每次执行完任务以后结果就散掉了,没有稳定的数据积累、反馈机制和人与系统之间的分工,它仍然可能只是一个非常强大的任务执行者
反过来,一个并不复杂的AI系统,只要能够和人、信息系统共同形成稳定的:

测试 → 记录 → 诊断 → 决策 → 学习 → 训练 → 再测试

循环,它就可能形成真正的能力系统。
可以用一句更简单的话来区分:

Agent让AI能够更自主地干活,能力系统让人、AI和信息系统共同形成持续解决问题的能力。

这个区别放到企业里尤其重要。
今天很多企业开始部署各种Agent。
销售Agent、客服Agent、财务Agent、人力资源Agent、研发Agent……
但拥有越来越多Agent,并不意味着企业已经形成越来越强的组织能力。
真正决定组织能力的仍然是:
  • 这些Agent究竟在解决什么业务问题;
  • 它们和员工如何分工;
  • 哪些决策必须由人承担;
  • 数据怎样沉淀;
  • 流程怎样衔接;
  • 结果怎样评价;
  • 问题如何反馈;
  • 整个体系如何继续进化。
所以:

Agent可以成为能力系统非常重要的组成部分,但Agent本身不是能力系统。

就像一个优秀员工不是一个组织,一套优秀软件也不是一套管理体系。
真正值得建设的,始终是围绕现实问题,把不同能力组织起来以后形成的那个整体。

十三、能力系统进入企业,就成为组织能力系统

这样一来,我过去提出的组织能力系统,就可以被放进一个更大的理论框架中。
最底层是各种独立能力。
但无论这些单项能力多么强大,它们都还不等于最终的系统能力。
当人的能力、AI能力以及包括Agent在内的各种技术能力,与信息系统围绕现实问题形成稳定分工,并能够持续运行时,才形成:

能力系统。

而当能力系统进入企业,它就会面对一系列企业特有的问题:
战略、组织结构、部门、岗位、权责、流程、制度、绩效、分配、数据治理、信息系统、组织文化、公司治理。
于是,能力系统进入企业环境之后,就进一步表现为:

组织能力系统。

因此,组织能力系统不再是一个孤立的企业管理概念。
它其实是一个更普遍机制在企业环境中的具体表现。
这也意味着,企业AI转型真正需要关注的,不能只是“部署了多少AI”“上线了多少Agent”,而应该进一步追问:

这些技术能力究竟有没有被组织成企业能够持续解决问题、创造结果的组织能力?


十四、这样理解以后,很多AI应用都可以重新看一遍

如果这个判断成立,那么能力系统显然不只存在于托福学习和企业管理。
 1、教育中可以形成能力系统。
学生、教师、AI和学习平台,可以围绕学习目标形成持续的教学、练习、评价和改进循环。
2、医疗中可以形成能力系统。
患者、医生、AI和医疗信息系统,可以围绕诊断、治疗和随访形成持续运行的诊疗体系。
3、科研中也可以形成能力系统。
科研人员、AI、数据库和实验系统,可以围绕科学问题形成文献研究、假设生成、实验、分析和验证循环。
4、个人知识工作同样如此。
一个人、AI、知识库和各种工作系统,可以围绕现实任务不断形成新的个人能力系统。
在这些场景中,Agent都可能成为越来越重要的组成部分。
但真正值得关注的并不是“这里有没有Agent”,而是:

这些能力最终有没有被组织成一套能够持续解决现实问题的系统。

所以AI时代真正值得关注的,可能并不只是:

AI越来越强。

而是:

AI让人类第一次可以用非常低的成本,把原本分散在人、专业知识和各种软件中的能力重新组合起来。


十五、AI正在改变的,也许是人类“形成能力”的方式

过去,一个人想获得某种能力,首先想到的通常是:
我要把这件事学会。
想开发软件,就学习编程。
想做数据分析,就学习统计。
想设计网页,就学习设计。
想准备托福,就买教材、背词汇、刷题、找老师。
这些事情今天当然依然重要。
但AI出现以后,我们开始拥有另一种形成能力的方式。
面对一个现实问题,我们可以不再只问:

我自己还需要学会什么?

还可以问:

为了持续解决这个问题,我应该怎样组织人的能力、AI能力和信息系统能力?

甚至还可以进一步问:

哪些任务值得交给Agent自主完成,哪些判断必须由人承担,哪些能力应该固化到信息系统里?

这是一种完全不同的思考方式。
我没有因为做出了托福模拟考试网页,就突然变成了专业程序员、托福教师、题库开发者和学习顾问。
但通过和AI协作,再借助信息系统把这些能力组合起来,我确实获得了一套过去并不拥有的、能够持续支持托福学习的能力。
所以,AI时代可能正在出现一种非常重要的新能力:

设计能力系统的能力。

未来人与人之间的重要差距,可能不仅在于谁拥有更多知识、掌握更多工具,甚至也不只在于谁更会使用Agent。
还可能在于:

谁更善于围绕现实问题,把人、AI、Agent和信息系统组织成一套真正有效的能力系统。


写在最后

我最初只是想准备一场托福考试。
于是做了一个模拟考试网页。
后来发现只有考试不够,于是加入成绩和能力分析。
发现错误不能消失,于是有了错题集。
发现生词不能每次重新遇到,于是有了个人生词表。
发现个人不会的词和托福普遍应该掌握的词不是一回事,于是又建立了基础词库。
发现知道问题仍然不能解决问题,于是继续形成训练建议和备考计划。
最后又必须通过新的模拟考试,验证前面的学习到底有没有产生效果。
一路做下来,我才发现:
真正形成的并不是一个功能越来越多的网页。
而是一套不断经历:

测试—记录—诊断—学习—训练—再测试

的能力系统。
这个小小的托福备考案例,也让我第一次跳出了企业的边界,重新理解了过去一直研究的组织能力系统。
也许更普遍的逻辑应该是:

面对现实问题,人可以把自己的能力、AI能力和信息系统能力重新组织起来,形成能够持续产生结果的能力系统。

Agent可以成为其中非常重要的一部分,但它并不是这个系统本身。
进入企业,能力系统成为组织能力系统。
进入教育,它可以成为学习能力系统。
进入科研、医疗和个人工作,也可以形成不同的能力系统。
所以AI真正改变的,可能不只是我们的工作效率,也不只是我们完成某项任务的方式。
它正在改变人类形成能力的方式。

抱歉,评论功能暂时关闭!