当 OpenAI 本周推出 GPT-6 Astra 时,一个演示引起了在前沿模型发布时很少受到关注的观众的特别关注:电气工程师。发布帖子展示了该模型在开源电子设计工具 KiCad 中设计电路板。但一小群工程师一直在问一个更难的问题——不是人工智能模型是否可以操作电子软件,而是它们生产的电路是否真正有效。

他们于 9 月 4 日以 EEBench 的形式给出了答案,这是一个新的公共基准,使用确定性 SPICE 模拟而不是人类判断来对人工智能设计的电路进行评分。早期结果表明,当前模型对电子设备的了解远比其输出通常显示的要多,但仍然无法解决现实世界中的零件行为,这也会让人类工程师犯难。 更多相关背景,请参阅我们的AI最新动态

为什么电路设计需要自己的基准

在 eebench.org 上发布基准测试的 EEBench 团队表示,其经验表明当前模型已经吸收了教科书、数据表、应用笔记和大量代码。瓶颈是接口。当代理操作 KiCad 等图形 CAD 工具时,它会花费大量精力点击菜单并跟踪屏幕上的内容,使用其上下文窗口的坐标和应用程序状态,而不是进行电气推理。

EEBench 采用了不同的方法。基准测试中的电路是用 atopile 编写的,atopile 是一种将电子设备描述为声明性代码的语言,因此代理可以直接在组件、连接和约束上工作。该模型可以修改设计、构建它、运行模拟并检查故障,而无需离开项目。据该团队称,这比要求模型在 GUI 中画线要好得多,而且它可以让基准测试电子知识而不是计算机使用技能。

真实零件,真实故障

一项公共任务来自住宅电表。当 5 伏电源消失时,电路必须让处理器再保持 20 毫秒的活动状态,以便保存累积的读数,同时受保护的电源轨始终保持在处理器的 3.0 伏掉电阈值之上。

该团队报告说,大多数模型都会立即得出正确的基本结论:添加电容器。基准测试让这件事变得比听起来更难。一旦在其上施加电压,真正的陶瓷电容器所提供的电容可能远小于其宣传的电容,部件具有公差,并且额外的电容会增加成本,占用空间,并在电源恢复时减慢电源轨的充电速度。

评分者发现了一份提交的材料,它说明了教科书答案和工作硬件之间的差距。设计标称 22 微法——这个值在纸面上看起来足够了。但在 4.7 伏偏压下,分级机测得的有效电容仅为 11.4 微法拉,远低于任务的 545 微法拉要求。源代码构建成功。电路仍然失败:仿真显示受保护的电源轨在仅 0.85 毫秒后就低于 3 伏要求,远低于所需的 20 毫秒。

更艰巨的任务会进一步推进。一项模拟任务需要在运算放大器周围合成一个多反馈低通滤波器,求解所需极点的电阻器和电容器比,并将增益、截止频率和 Q 值保持在限制范围内,即使每个组件都被推至最坏情况的容差角。

评分如何运作

EEBench 检查是完全确定性的。该线束构建提交的设计,构建电路图和物料清单,并运行一组 SPICE 模拟和设计检查,每个要求都会针对数字限制生成测量结果。任务测量增益、阈值、纹波、瞬态响应和组件容差角处的行为。技术分数与参考材料清单的成本效率衡量标准相结合——尽管成本只有在电路工作后才有帮助。

该团队将该设置与为编码代理提供编译器和测试套件进行了比较,不同之处在于测试测量电压和组件行为。版本 1 中的所有任务都使用真实的制造商零件,其规格从数据表中提取并带入模拟模型中,迫使代理寻找存在的、可订购的且价格合理的组合。

第一个排行榜

9 月 1 日的结果使 Claude Opus 5 在 EEBench V1 中名列前茅,在 13 项任务中以 61.6% 的成绩名列前茅。 Grok 4.6 以 57.1% 位居第二,仅领先于 Claude Fable 5.1(56.4%)。 《克劳德寓言 5》得分为 54.3%,《克劳德 Opus 4.8 Max》得分为 51.4%。该团队指出,几个月前,他们并没有期望模型能够表现得这么好。

其中一个结果让团队特别满意:xAI 在 Grok 4.6 模型卡中包含了 EEBench,该部分涉及工程加速以及 3D 建模和参数化 CAD 评估。 xAI 自己发布的运行得分为 Grok 4.6,得分为 60.0%,具有 xhigh 推理能力。根据 xAI 的发布材料,该模型获得了高质量的工程数据和特定领域环境中的强化学习训练,包括计算机辅助设计。

到目前为止,OpenAI 测试的模型排名靠后:GPT-5.5 得分为 42.3%,GPT-5.6 Sol 为 39.4%。目前还没有 GPT-6 Astra 结果——考虑到该模型的 KiCad 演示重新引发了人们的关注,这是一个显着的差距。该基准的排行榜、方法论和样本结果浏览器都是公开的,实验室可以运行自己的模型。

它尚未测量什么

EEBench V1 仅涵盖通过仿真进行的模拟和数字设计。它还没有测试一个模型是否可以布置物理板、制造它或生产成品——出现全新故障模式的阶段。该团队表示,他们希望稍后添加这些阶段,但将版本 1 的重点放在需求-设计-验证循环上,因为有用的工程工作已经可以在其中进行客观分级。

尽管如此,该基准的到来还是在一个关键时刻。前沿实验室现在在模型卡中引用了它,发布演示将电子产品放在了首页,最高分(61.6%)表明模型变得有意义,但仍然远不可靠。对于观看的电气工程师来说,第一个 EEBench 结果所传达的信息是:人工智能可以越来越多地在纸上设计电路。它们是否能在与真实零件的接触中幸存下来,这正是该基准测试的目的。

---

掌握AI最新动态

获取最新的AI新闻、分析和突破——尽在一处。

阅读更多AI新闻 →