
每次限时练习结束,拿到试卷后最头疼的是什么?
不是批改,不是讲评——是萃取知识点。要从一套试卷里,把超纲生词、高阶短语、熟词生义、词类活用、长难句一项项挑出来,对照课标词表逐词筛选,再排版成一份可用的 Word 文档发给学生……一套试卷下来,少则两三小时,多则半天。
这篇文章记录我用 AI(WorkBuddy)把这件事从半天压缩到几分钟的完整过程——包括怎么把试卷交给 AI、AI 怎么萃取、萃取的技能怎么搭建,以及和 ima 知识库怎么对接。
一句话概括:我把试卷文档丢给 AI,它自动读取 ima 知识库里的课标词表和教材词表,建立"学生已掌握"的词汇边界,然后只把对这批学生有难度的生词、短语、熟词生义、长难句萃取出来,生成排版规范的 Word 文档。
整体架构:一张图看懂全流程

整个流程分三层:输入层(试卷文档)→ 知识库层(ima 存的课标和教材词表)→ AI 处理层(建立边界 + 筛选萃取 + 排版生成)→ 输出(排版规范的 Word 文档)。
· · ·
实操流程:从丢试卷到拿文档
1. 把试卷交给 AI
直接把试卷文件丢进对话框。支持 PDF、Word、图片三种格式。AI 会自动解析文档内容,提取全文文字。


就这么简单。不需要手写指令,丢文件 + 说一句"萃取知识点"就够了。因为萃取规则已经固化在 Skill 里了(后面会讲怎么搭)。
2.AI 读取知识库,建立词汇边界
这是整个流程的关键一环。AI 不是无差别地把试卷所有生词都列出来,而是先去 ima 知识库里"查户口"——这批学生已经学了哪些词?
AI 会依次读取以下基准资料:
把这些词表合并后,AI 就有了一个"学生已掌握词汇"的完整集合。这个集合就像一道筛子——试卷上的词,如果在集合内就跳过,不在集合内才提取。
为什么要这么严格? 因为知识点萃取的核心不是"列出所有生词",而是"只列出这批学生真正不会的"。高一新生和高三学生的词汇边界完全不同,萃取结果也完全不同。
3.对照边界,逐词筛选
有了词汇边界,AI 开始逐词、逐句扫描试卷,按以下规则筛选:
| 过滤 | |
| 保留 | |
| 保留 | |
| 保留 | |
| 保留 | |
| 保留 |
优先级也有讲究:出题处的线索原文 > 阅读/七选五/完形/语法填空的高频考点 > 简单基础题。不是所有生词都值得萃取,只有和出题相关的才保留。
4.生成排版规范的 Word
筛选完成后,AI 调用一个 python-docx 排版引擎,把结果生成 Word 文档。排版参数是硬编码的,每次都一样:
| 无 | |
输出文档分两大模块:
模块一|高阶生词 & 短语
按文章顺序排列(A篇→B篇→C篇→D篇→七选五→完形→语法填空),每条格式:

模块二|长难句解析


· · ·
核心揭秘:萃取 Skill 是怎么搭的
前面说的"丢个文件就能萃取",不是因为 AI 聪明,是因为我把萃取的规则、方法、排版参数全部固化成了一个 Skill。可以把 Skill 理解成一份"操作手册"——AI 每次读这份手册,就知道该怎么干活。
Skill 的结构:九大模块
我把萃取流程拆成了九个部分,写成一份 Markdown 文件(SKILL.md),存放在 AI 的工作目录下:
关键设计决策
1. 为什么用 Skill 而不是每次写指令?
每次萃取的流程是一样的——读词表、筛词汇、排版。如果把这套规则写进 Skill,每次只需要"丢文件 + 说一句话",AI 自动按 Skill 里的流程执行。省去重复写指令的时间。
2. 为什么把排版参数硬编码?
用 python-docx 写了一个 build_kp_docx.py 脚本,把所有排版参数(宋体、Times New Roman、五号、行距16磅、页边距1.5cm、无表格)全部写死在代码里。每次生成 Word 都调用这个脚本,保证每次排版的输出完全一致,不会因为 AI 的"心情"而变化。
3. 为什么禁止行为要单独列一节?
AI 最容易犯的错误就是"大而全"——把试卷所有单词都列出来。明确禁止这种行为,才能保证输出的是精炼的学情素材而不是词汇大全。同时还禁止了给答案、编造释义、用表格等行为。

· · ·
知识库对接:ima 怎么和 AI 连起来
整个萃取流程最"神奇"的地方是——AI 怎么知道课标里有哪些词?怎么知道译林教材学了哪些词?答案在 ima 知识库。
ima 知识库里存了什么
我在 ima 里建了两个知识库,专门给 AI 当"查户口"的依据:
| 教材+课标 | ||
| 高考英语命题素材库 |
AI 怎么读取 ima 知识库
WorkBuddy 支持连接 ima 知识库(已通过 ima-mcp 连接器打通)。AI 在萃取时会:
①搜索知识库
AI 通过 ima 的搜索接口,在"教材+课标"知识库里检索课标词汇表和教材词汇表。比如搜索"高中课标词汇表 附录2"就能找到课标 PDF 中的词汇表部分。
②读取并解析
AI 读取找到的 PDF 内容,解析出词汇列表。课标词汇表是结构化的(按字母排序),教材书后词汇表也是结构化的(按单元排列),解析后可以得到一个完整的词汇集合。
③合并建立边界
把初中课标词表(网上补位)+ 高中课标词表 + 译林7册词表 + 高考新增词汇合并成一个大的"已掌握词汇"集合。这就是词汇边界。
④对照边界筛选
扫描试卷每个词,在边界集合里查找——找到了就跳过,没找到就提取。熟词生义则需要额外判断:这个词在边界内,但本卷用了一个不在常见义项里的释义。
一次配置,永久生效
ima 知识库的对接是一次性的工作。配置好之后,每次萃取都自动读取,不需要重复操作。知识库里的资料更新了(比如新课标修订),只需要在 ima 里替换文件,AI 下次萃取就会用新的边界。
· · ·
实际效果:潍坊3模萃取实录
以潍坊3模为例,整个过程大约 3-5 分钟。以下是实际输出:
模块一|高阶生词 & 短语(按篇章顺序)A篇remote /rɪˈməʊt/ adj. 遥远的,偏远的▸ 原文短语:remote areas(偏远地区)......熟词生义(置底)address 地址 → 处理/应对(address the problem)champion 冠军 → 支持/捍卫(champion a cause)
模块二|长难句解析【原句】What concerns the author most is not the physical challenges of living on Mars, but the psychological toll that an unnatural, isolated existence would take on the human mind.【句式拆解】主语从句 What concerns the author most 作主语;is not...but... 并列结构表对比;that 引导定语从句修饰 toll。【中文翻译】令作者最担忧的不是生活在火星上的身体挑战,而是一种不自然的、与世隔绝的生活方式对人类心理造成的伤害。
拿到这样的文档,直接打印发给学生,零排版工作量。学生拿到的是一份精确到"自己不会的词"的学情素材,而不是一本大而全的词汇手册。
写在最后
这套工作流的核心思路是:把教学经验固化成 AI 能执行的规则。
点赞“👍”+在看“❤️”,谢谢鼓励!