📖 《让 AI 学透高考命题规律,帮我出了一套物理卷》系列第④篇。前三篇用的是 Claude Code:从第一次尝试,到和它死磕十版,再到给它配“命题组”、让它读 100 份真题。这篇换 Muse——9 月 2 日,Muse Spark 1.3 发布。最近它实在太火,热度甚至盖过了 GPT,也彻底勾起了我的好奇。中秋晚上刚注册好账号,我就忍不住把它拉出来溜溜。作为物理老师,我的验收标准很直接:出卷行不行,画图行不行。还是一次尝试,谈不上成熟,写出来和同行交流,欢迎拍砖。
🔄 一、为什么拿出卷来“溜”它
好奇是起因,但拿什么溜它,我是想过的。前三篇用 Claude Code,走的是“配命题组”的路子:组长、命题员、配图员、答案员、质检员、教研员,再加一个蒙着答案盲做的审题员,从 100 份真题里抽“情境内核”。这一次,Muse走了另一条路——不拼角色,拼工程:先把 110 份资料变成一本可检索的索引,再拿双向细目表把“考什么、考多深”锁死,最后才动手命题。图也不让它“画”,而是用代码“算”出来。
验收标准还是两条:出卷行不行,画图行不行。这两道坎,在我这儿一直没过去。用 Claude Code 那次,最磨人的就是画图(磁场符号、元件不能多画、偏转方向必须自洽,一张张纠到半夜),以及难度的取舍(总是达不到高考的深度,梯度拉不开)。
所以这次,我让 Muse 先别急着出卷:先把 110 份资料一份份读完、建成索引,再拿双向细目表把“考什么、考多深”定死,最后才动手命题。图也不让它“画”,而是用代码“算”出来。
先说在前面:卷子已经成卷,质量到底怎么样,我说了不算。这篇文章只记录过程,评判权交出来——我会把试卷、答案和评分标准一起公开,欢迎同行试做、拍砖。
📥 二、第一步:先攒“弹药”,再建索引
AI 出卷最大的坑,是“凭空出题”——没有语料,它只能凭记忆编,知识点覆盖随缘,难度随缘,撞题概率还高。
所以这一步,我让 Muse 先攒了一个题库:2023–2026 年江苏高考物理真题(含解析和完全解读)、各地高三联考调研卷、一模二模、章节练习、实验讲义、场景专题……一共 110 份资料,全部归档。
但资料堆在那里不等于能用。第二步是建索引:108 条记录,每份资料是什么类型、覆盖哪些章节、题型结构、难度、情境特色,一条一条登记。

▲ 图:110 份资料的构成——章节练习是大头,高考真题是逐题拆解的最细粒度
其中最细的是江苏真题:2023 到 2026,每一年的卷子都拆到题号——第几题、什么题型、多少分、考哪个知识点、什么情境、什么难度。这一步最费事,但也最值钱:后面 Muse 命题时,知识点分布、难度梯度、情境风格,全都对着这份真题档案来,不至于跑偏。
🔍 三、关键不在“生成”,在“先审表、再命题”
很多人用 AI 出卷,提示词只有一句话:“出一份高三物理模拟卷。”出来的东西当然没法用。我让 Muse 把出卷拆成流水线,每一步我都参与:
🎯 先定四项参数:考试范围(这次是整个高考范围)、题型分值(按江苏卷标准:单选 11 题×4 分=44 分,实验题 1 道,计算题 4 道,满分 100 分)、难度定位(对标高考真题)、考试时长(75 分钟)。
🎯 再出双向细目表。这是整个流程里我最坚持的一环:命题之前,先出一张表——题号×知识点×题型×分值×难度,每道题考什么、占多少分、什么难度,一目了然。这张表必须我先审过,确认知识覆盖和难度梯度没问题,Muse 才往下走。没有这一步,Muse 出的卷子也很容易“头重脚轻”,梯度更是无从谈起。

▲ 图:双向细目表(示例)——命题前先审表,实际表格由老师确认
🎯 然后才命题:11 道单选覆盖力学、电磁、热、光、近代物理,难度前易后难;1 道实验题;4 道计算题按“热学/基础力学→中档综合→电磁或多体动力学压轴”排梯度。情境可以借鉴真题改编——换数据、换条件、换设问,但不照搬原题。
🎯 最后是答案与校验:计算题按步骤给分,得分点写清楚;人审三关——有没有超纲、有没有和学生做过的题撞车、有没有科学表述错误。Muse 出的东西,这三关一道都不能少。

▲ 图:这次出卷的完整工作流——7 个步骤,老师始终在关键节点拍板
🎨 四、画图:对着教材一遍遍抠
上次出卷,画图是最磨人的一步。这次我换了个路子:图全部用代码精确绘制,而不是让 Muse “画”出来。代码画的图,线条、标注、符号都是确定的、可控的——“这个电场线画密一点”“把滑块往左挪”,改起来是一句话的事,不用整张重画。
但“代码能画”不等于“画得对”。Muse 第一版交出来,我看着就不对劲——电容器那一块,它就没好好学。
我让它去翻人教版教材,一条条对。电容器,必修三图10.4-1画的是两条等长平行细线,导线要连到极板上——Muse 第一版导线悬在半空,根本没挨着极板。开关,必修三图12.2-1的单刀单掷,闸刀是直接连在导线上的,根本没有支点小圆圈——Muse 画了个空心圆,看着就假。磁场更要命:“垂直导轨平面向上”不等于“垂直纸面”,不能用·表示;后来我干脆让它别画箭头,在图边上注明“B/垂直导轨平面向上”。
光一张图15-1,前后改了十版。从“代码能画”到“画得和教材一样”,中间差的是对教材画图语言的敬畏。这一环,我现在是这么定的:所有元件符号,必须能在教材里找到出处,找不到的,一律不许画。
这次卷子一共配了 16 张图,没有一张是手画的,也不用再开几何画板一条条抠。但省下来的时间,全花在“抠细节”上了。
🧑🏫 五、Muse 打下手,老师做主审
Muse 没有替代出卷的任何一个环节,它替代的是环节里的体力劳动。
定考什么、怎么考、难到什么程度——这些判断还是老师的。双向细目表我审,终稿我审,评分标准我定。Muse 负责的是:从 110 份资料里快速定位素材、按细目表组卷、画图、整理答案格式。
顺序不能反。如果一上来就让 Muse“出一套卷”,出来的就是没有灵魂的拼凑题;但如果老师先搭好框架、定好标准,Muse 就是个效率极高的助手。
多说一句:交卷前,我还让 Muse 换了个身份——当“审题员”,拿着光题干(不给答案)把整卷盲做一遍。这个点子是从③借来的,但用法不一样:③的审题员是命题组里的固定角色,我这儿是把它当成卷后的独立质检。结果第一天就立功:逮出两张配图泄题——图上直接标了待求量的数值,学生看图就能读出答案。同一条生成链路,很容易对自己的错误视而不见;换一个没看过答案的审题员盲做,更容易暴露问题。这一环,我打算固定下来。
📊 六、难度:派个“教研员”审一遍
卷子出来了,难度到底怎么样?我自己说了不算——但也不能直接发。我让 Muse 再换个身份:当“教研员”,对着近三年江苏真题,把整卷从头到尾审一遍,逐题定级,给出难度回算。
结论:整卷和真题基本相当、略偏易,预估均分63—68分。但它指出了三个具体问题,全改了:
① 第10题太“模板”——B-t直线求电动势,公式一套就有。改:B-t换成正弦 B=(2.0+1.0sin10πt)T,求 t=0.10s 时的瞬时电动势和电流方向。陷阱在于,B(0.10s)恰好等于B(0),用平均变化率会得出“0”的错误答案;正确做法是求该点切线斜率,得 10πV,方向顺时针。配图也重画成了正弦曲线。
② 第14题(2)太“白给”——机械能守恒一步出答案,4分没拉开层次。改:保留“求落地速度 v=10m/s”(2分),再加一问“落地速度与水平方向夹角 α 和 45° 比大小”(2分)——得先算出 tanα=√39/6>1,才知道 α>45°。4分题有了内部梯度。
③ 第15题(2)有“全军覆没”风险——电容导轨证匀加速,I=CBLa 这一步想不到,4分全丢。改:题干加一句提示“电容器极板电荷量 q=CU,充电电流 I=Δq/Δt”,把“难”降为“中偏难”,更符合12分题的定位。
改完,梯度就顺了:选择题填上了第7—11题之间的凹陷,计算题第14题不再断档。“难度回算”这一环,我打算固定下来——以后每套卷子,成卷后都让“教研员”审一遍再发。
🗳️ 七、评判,交给你们
说了这么多,卷子质量到底怎么样,我说了不算。
这份卷子已经成卷,我会把试卷、答案和评分标准一起放出来,欢迎同行老师拿去试做,也欢迎直接拍砖:哪道题超纲了、哪道题情境生硬、哪道题梯度没拉开,都可以来评论区聊。
下一篇,我会写这份卷子的实测复盘——从双向细目表到成卷,逐题讲讲取舍。想看的可以关注「流霜不觉飞zj」。
🤔 八、写在最后:几点思考
✅ 我觉得这次做法的优势在于:
① 先有题库和索引,AI 不是凭空出题——知识点覆盖和难度梯度都有真题档案托底,专治“梯度拉不开”;
② 双向细目表先审后命——老师在最关键的一步拍了板,卷子的骨架是人的,不是机器的;
③ 图用代码画、对着教材抠——规范可控,专治“画图难”,元件符号都能在教材里找到出处;
④ “审题员”盲做+“教研员”难度回算——成卷后两道独立质检,一个抓泄题,一个抓梯度;
⑤ 答案按步骤给分、带评分标准——阅卷的是人,标准必须人能执行。
⚠️ 但不足也很实在,老实说:
① 前期成本不低——攒 110 份资料、建 108 条索引、逐题拆解四年真题,都是实打实的功夫,不是打一句话就出片;
② AI 依然不懂我班的学情——哪个考点今年要强调、难度配不配得上,还得我拍板;
③ 画图这一关,谁都没过去。Muse 跟 Codex、Claude Code 一样,在画图上都达不到我的要求——不是“能不能画出来”,是“画得对不对”。磁场符号、元件规范、轨迹自洽,每一张都得人盯着改;
④ 难度跟高考比还差得远。这套卷子的梯度、深度、压轴题的“巧劲”,都够不上真题。这一点,三家 AI 都一样;
⑤ 横向对比说句大实话:总体上还是 Claude Code 做得最好,命题深度和压轴题的“狠劲”目前没被超过。但 Muse 有两个让我印象深刻的优点——一是快,同样的活它干得飞快,效率很高;二是学得快,指出的问题它改得又快又准。而且同样折腾下来,感觉它的额度消耗最少。所以出卷这件事,目前没有一家 AI 能独立交卷;Muse 是个效率极高的助教,Claude Code 是个命题更深的搭子,怎么组合用,看老师的需求。下一轮,我打算把“难度回算”和“教材对图”都固定成标准动作。
一句话总结:Muse 不是替我出卷,而是把我从体力活里解放出来,让我能把精力放回“这道题到底该考什么”。它是个很好的助教,但主刀的,还得是老师。
这只是一次尝试,不成熟的地方还很多。如果你也在为出卷、画图、改编题发愁,希望这篇能给你一点启发。有想法,欢迎留言一起聊。
📎 附:完整试卷截图