大家好,我是张托肯。
首版包含50 道 Agentic 长程任务。截至 2026 年 8 月 2 日,已测试17 个模型,共获得 2550 条完整轨迹。
测试方式为:每个模型、每道题独立运行 3 次,每次最多 2 小时。
在此简要说明一下结论:
Claude Fable 5 Max 的任务通过率(Pass@1)约为 79%;
GPT-5.6 Sol Max 为 67%;
Claude Opus 4.8 Max 为 63%;
Deepseek V4 flash 正式版为 43%。
此外,较多模型的通过率集中在 10%至30%,说明当前榜单具有较好的区分度。
完整排行如下:

每个模型的 Pass@1 通过率根据其在 50 道题上的 150 次独立 rollout 计算,即其中 reward=1 的比例。
我们还记录了每条轨迹的 token 用量、操作步数和运行耗时。平均每条轨迹包含超过 120 轮交互,运行时间超过 1 小时。
成本依据评测时各模型的官方计费标准估算,并按照各家模型的实际计费口径,分别统计输入、缓存输入、输出、推理和缓存写入等费用。

单任务平均 API 成本,按照token类别拆分
通过率相近时,成本差异会直接影响工程价值。将通过率与成本绘制成散点图,可以直观比较不同模型的性价比。

各模型单次任务的通过率与开销对比,其中左上方向性价比更高
Analog Design Bench v1 的当前结果已经上线:
https://analog-design-bench.tokenzhang.com/
欢迎关注,网站将持续更新。
01 任务设置
每道任务都运行在相互隔离的两套容器镜像中:一套用于 Agent 做题和调试,另一套用于最终评分。
在做题环境中,Agent 需要独立编写 DUT 电路和调试用 testbench。
公开 testbench 可以作为起点,但只覆盖部分诊断条件;Agent 需要根据完整的指标要求,自行补充 PVT 组合和边界情况,通过仿真不断迭代电路;每次 rollout 最多运行 2 小时。
Agent 主动结束任务或运行超时后,系统会提取其最后保存的电路网表并提交到评分环境。
Agent 编写的调试用 testbench 不会被提交,也不参与最终评分。
在评分环境中,使用 Agent 无法访问的隐藏 testbench,根据预先定义的指标和阈值自动验证电路,全程不包含人工或其他模型的主观判断。
只有所有必需指标均满足、最终 reward=1 时,该次 rollout 才计为通过;部分指标达标可以获得部分分数,但不计入任务通过率。
02 四道例题
为了方便理解基准评测具体在做什么,下面介绍四道例题。
例题一:LNA
电感源极退化 LNA 是射频集成电路设计中的经典电路,也是理解输入匹配、噪声、增益和稳定性权衡的代表性任务。
评测集中的这道题要求 Agent 基于 Sky130 工艺,设计一个 2.4 GHz、50 Ω 单端窄带电感源极退化 LNA。
按照传统射频集成电路课程的标准,这道 LNA 题大致相当于研究生专业课的综合设计作业。
题面全文如下:

需要满足的要求和指标包括:
器件限制:仅可使用Sky130官方PDK器件,禁止使用理想电阻、电容、电感和开关。
PVT 范围:覆盖 tt、ss、ff,1.62 V、1.80 V、1.98 V,以及 −40 ℃、27 ℃、125 ℃组成的 27 种组合。
射频指标:在2.35 GHz至2.45 GHz内,传输增益≥12 dB,增益波动≤1.5 dB,S11和S22均≤−10 dB。
噪声与隔离:噪声系数≤2.0 dB,反向传输S12≤−30 dB。
稳定性指标:在0.1 GHz至10 GHz内,Rollet K≥1.2,Δ≤1.0。
功耗与偏置:功耗≤10 mW,测试平台提供50 μA参考电流,iref电压≥0.40 V,并且至少比VDD低0.10 V。
开始答题时,Agent 只会拿到一个 SPICE 网表框架。框架定义了对外接口,内部电路需要由 Agent 完整设计。

为了减少随机波动,每个模型在同一个题目上测试三次。
在 17 个模型的测试中,上述 LNA 题目只有 Fable 5 能实现 3/3 通过。

例题二:全差分单级 OTA
OTA 是模拟集成电路中的基础模块,可以考验基本电路设计和仿真迭代能力。
从电路拓扑来看,设计一个单级全差分 OTA 属于模拟集成电路课程中的入门设计作业;但评测要求覆盖 45 种 PVT 组合,并同时验证噪声、功耗、共模控制和大信号瞬态响应,验证范围明显超过普通的入门作业。
评测集中的这道题要求 Agent 采用 NMOS 输入对和有源连续时间共模反馈,设计一个单级全差分 OTA。
要求在 45 种 PVT 组合下同时满足增益、带宽、相位裕度、噪声、功耗、输出共模精度及大信号瞬态响应等要求。
核心指标包括增益不低于 40 dB、单位增益带宽不低于 20 MHz、相位裕度不低于 60°,以及特定频率区间内的输入等效噪声不高于 50 μVrms。

从当前结果看,接近一半的模型能够通过。

例题三、全差分两级 OTA
相比于单级,全差分两级 OTA 的难度显著提高。
评测集中的这道题要求 Agent 设计一个带有共模反馈和频率补偿的全差分两级 OTA,并在多个 PVT 条件下同时满足增益、带宽、稳定性和瞬态响应等要求。
按照传统模拟集成电路课程的标准,这道题大致相当于本科高年级或硕士一年级的专业课大作业。
结果也体现了这种难度差异:只有 Fable 5 的三次测试全部通过(3/3),大部分模型在三次运行中均未能获得任何分数。

例题四:LDO
LDO 是模拟与电源管理电路设计中的基础模块,在各类芯片中广泛存在。
按照传统模拟集成电路课程的标准,全晶体管级 LDO 设计大致相当于本科高年级或研究生一年级的专业课大作业。
评测集中的这道题在常规课程设计的基础上,进一步加入了 135 种 PVT 与负载组合、多种输出电容和 ESR、启动与跳变响应、PSRR、噪声以及 30 组蒙特卡洛失配测试,验证范围接近工业芯片前仿真阶段的综合设计任务。Agent 需要使用 Sky130 工艺设计一个采用 PMOS 调整管和五晶体管 OTA 的 LDO,通过反馈环路将输出电压稳定在 1.2 V。
题面全文如下:

需要满足的指标包括:
电路要求:采用PMOS调整管和五晶体管OTA,测试平台提供0.8 V参考电压、50 μA偏置电流、外部反馈网络及输出电容。
PVT范围:覆盖tt、ff、ss、fs、sf,3种输入电压、3种负载和3种温度组成的135种组合。
DC指标:输出电压保持在1.2 V±20 mV以内,静态电流≤200 μA,30 mA负载下Dropout电压≤250 mV。
AC指标:1 Hz环路增益≥40 dB,相位裕度≥60°,单位增益带宽≥50 kHz。
电源与噪声:PSRR在100 Hz和1 kHz处≥40 dB,在100 kHz处≥20 dB,在1 MHz处≥10 dB;积分输出噪声≤150 μVrms。
动态指标:启动过冲≤50 mV;负载和输入电压跳变时,输出偏差≤20 mV,并在5 μs内恢复到目标值±15 mV以内。
鲁棒性指标:稳定性和瞬态测试覆盖多种输出电容与ESR组合;30组失配测试中,至少90%的输出电压位于1.17 V至1.23 V之间。
在17个模型的测试中,没有一个稳定通关,只有 Fable 5 和 GPT-5.6-sol 实现了 2/3 通过。说明这题具有较大的难度,触及了模型的能力边界。

按满分通过率从高到低排序,这四道题在 50 道题中分别位列第 6、第 32、第 35 和第 37,覆盖了从相对基础到较高难度的任务。
它们横跨模拟、射频和电源管理电路,体现了测试集在任务类型和难度上的多样性。

03 后续计划
Analog Design Bench v1 是预览版(Preview),也可以理解为一次摸底考试。
本轮评测初步刻画了不同模型在长程模拟电路设计任务中的能力水平、性能差异和能力边界,同时验证了题目设计、运行环境、跑分测试和成绩统计流程,并帮助我们发现和修正题面歧义与评测漏洞。
接下来,我们将选择部分题目,分批公布题面、单题结果和典型 Agent 轨迹,供更多读者和专业设计者核验。
其余题目将继续保留,用于后续模型测试,以控制测试集污染。
Analog Design Bench v2 将作为正式版发布。
目前,我已经邀请超过 10 位具有真实流片经验的芯片设计者,共同复核现有题目并贡献新题目,以提高测试集的准确性、代表性和多样性。
参与成员分布在 3 个国家,来自 6 所高校和 4 家芯片公司。待题目扩充和专家复核完成后,我们将择期发布第二版。
此后,我们还会邀请更多芯片设计者、老师和专家参与,继续完善这一基准测试,并推出第三版及后续版本,敬请关注!