Khi OpenAI công bố GPT-6 Astra vào tuần này, một bản demo đã thu hút sự chú ý đặc biệt từ một đối tượng hiếm khi được chào đón khi ra mắt mô hình biên giới: các kỹ sư điện. Bài ra mắt giới thiệu mô hình thiết kế bảng mạch trong KiCad, công cụ thiết kế điện tử nguồn mở. Nhưng một nhóm nhỏ kỹ sư đã đặt ra một câu hỏi khó hơn – không phải liệu các mô hình AI có thể vận hành phần mềm điện tử hay không, mà là liệu các mạch mà chúng tạo ra có thực sự hoạt động hay không.

Câu trả lời của họ đến vào ngày 4 tháng 9 dưới dạng EEBench, một tiêu chuẩn công khai mới nhằm chấm điểm các mạch do AI thiết kế bằng cách sử dụng mô phỏng SPICE xác định thay vì phán đoán của con người. Các kết quả ban đầu cho thấy các mô hình hiện tại biết nhiều hơn về thiết bị điện tử so với kết quả đầu ra của chúng thường thể hiện, nhưng vẫn thất bại ở loại hoạt động của bộ phận trong thế giới thực mà các kỹ sư con người cũng gặp phải. For more context on this story, see our ongoing latest AI developments.

Tại sao thiết kế mạch cần chuẩn riêng của nó

Nhóm EEBench, nơi công bố điểm chuẩn tại eebench.org, cho biết kinh nghiệm của họ cho thấy các mô hình hiện tại đã hấp thụ được sách giáo khoa, bảng dữ liệu, ghi chú ứng dụng và số lượng lớn mã. Điểm nghẽn là giao diện. Khi một tác nhân vận hành một công cụ CAD đồ họa như KiCad, nó sẽ dành phần lớn nỗ lực của mình để nhấp qua các menu và theo dõi những gì trên màn hình, sử dụng cửa sổ ngữ cảnh của nó với tọa độ và trạng thái ứng dụng thay vì suy luận về điện.

EEBench có cách tiếp cận khác. Các mạch trong điểm chuẩn được viết bằng atopile, một ngôn ngữ mô tả thiết bị điện tử dưới dạng mã khai báo, do đó tác nhân hoạt động trực tiếp trên các thành phần, kết nối và ràng buộc. Mô hình có thể sửa đổi thiết kế, xây dựng nó, chạy mô phỏng và kiểm tra các lỗi mà không cần rời khỏi dự án. Theo nhóm, điều này hoạt động tốt hơn nhiều so với việc yêu cầu một mô hình vẽ các đường trong GUI - và nó cho phép điểm chuẩn kiểm tra kiến ​​thức điện tử hơn là kỹ năng sử dụng máy tính.

##Phụ tùng thật, Thất bại thật

Một nhiệm vụ công cộng được rút ra từ đồng hồ đo năng lượng dân cư. Khi nguồn 5 volt của nó biến mất, mạch phải giữ cho bộ xử lý hoạt động thêm 20 mili giây nữa để nó có thể lưu các số đọc tích lũy, với đường ray được bảo vệ luôn ở trên ngưỡng mất điện 3.0 volt của bộ xử lý trong suốt thời gian đó.

Nhóm báo cáo cho biết hầu hết các mô hình đều ngay lập tức đi đến kết luận cơ bản đúng: thêm một tụ điện. Điểm chuẩn làm cho điều đó khó hơn âm thanh. Một tụ điện gốm thực sự có thể cung cấp ít hơn nhiều so với điện dung được quảng cáo khi điện áp được đặt trên nó, các bộ phận mang dung sai và điện dung bổ sung sẽ làm tăng thêm chi phí, chiếm không gian và làm chậm quá trình sạc lại của đường ray khi có điện trở lại.

Các học sinh chấm bài đã nhận thấy một bài nộp minh họa khoảng cách giữa câu trả lời trong sách giáo khoa và phần cứng đang hoạt động. Một thiết kế chỉ định 22 microfarad trên danh nghĩa - một giá trị có vẻ đủ trên giấy tờ. Nhưng ở độ lệch 4,7 volt, máy chấm điểm chỉ đo được 11,4 microfarad của điện dung hiệu dụng, thấp hơn nhiều so với yêu cầu 545 microfarad của nhiệm vụ. Mã nguồn được xây dựng thành công. Mạch vẫn bị lỗi: mô phỏng cho thấy đường ray được bảo vệ giảm xuống dưới mức yêu cầu 3 volt chỉ sau 0,85 mili giây, không bằng mức 20 mili giây được yêu cầu.

Nhiệm vụ khó khăn hơn đẩy xa hơn. Một phép gán tương tự yêu cầu tổng hợp bộ lọc thông thấp đa phản hồi xung quanh op-amp, giải tỷ số điện trở và tụ điện cho các cực cần thiết, đồng thời duy trì mức tăng, tần số cắt và Q trong giới hạn ngay cả khi mọi thành phần bị đẩy đến góc dung sai trong trường hợp xấu nhất.

Cách thức chấm điểm

Kiểm tra EEBench hoàn toàn mang tính quyết định. Dây nịt xây dựng thiết kế đã gửi, xây dựng biểu đồ mạch và danh mục vật liệu, đồng thời chạy một bộ mô phỏng SPICE và kiểm tra thiết kế, với mỗi yêu cầu tạo ra một phép đo theo giới hạn số. Nhiệm vụ đo lường mức tăng, ngưỡng, gợn sóng, phản hồi nhất thời và hành vi ở các góc dung sai thành phần. Điểm kỹ thuật được kết hợp với thước đo hiệu quả chi phí so với danh mục vật liệu tham khảo - mặc dù chi phí chỉ có tác dụng khi mạch hoạt động.

Nhóm so sánh quá trình thiết lập với việc cung cấp cho tác nhân mã hóa một trình biên dịch và bộ thử nghiệm, ngoại trừ các thử nghiệm đo điện áp và hoạt động của thành phần. Tất cả các nhiệm vụ trong phiên bản 1 đều sử dụng các bộ phận thực của nhà sản xuất, với các thông số kỹ thuật được trích xuất từ ​​​​bảng dữ liệu và đưa vào mô hình mô phỏng, buộc tác nhân phải tìm ra các kết hợp tồn tại, có thể đặt hàng và có giá cả hợp lý.

Bảng xếp hạng đầu tiên

Kết quả ngày 1/9 đưa Claude Opus 5 đứng đầu EEBench V1 với 61,6% qua 13 nhiệm vụ. Grok 4.6 đứng thứ hai với 57,1%, chỉ trước Claude Fable 5.1 với 56,4%. Claude Fable 5 đạt 54,3% và Claude Opus 4,8 Max 51,4%. Nhóm nghiên cứu lưu ý rằng một vài tháng trước họ không mong đợi các mô hình sẽ hoạt động tốt như vậy.

Một kết quả khiến nhóm đặc biệt hài lòng: xAI đã đưa EEBench vào thẻ mô hình Grok 4.6, trong phần về tăng tốc kỹ thuật cùng với đánh giá mô hình 3D và CAD tham số. Lần chạy được xuất bản của chính xAI đã ghi được Grok 4,6 ở mức 60,0% với nỗ lực suy luận xhigh. Theo tài liệu ra mắt của xAI, mô hình này đã nhận được dữ liệu kỹ thuật chất lượng cao và đào tạo học tập tăng cường trong các môi trường dành riêng cho miền, bao gồm cả thiết kế có sự hỗ trợ của máy tính.

Các mô hình của OpenAI đã được thử nghiệm cho đến nay nằm ở vị trí xa hơn trong bảng: GPT-5.5 đạt 42,3% và GPT-5.6 Sol 39,4%. Vẫn chưa có kết quả GPT-6 Astra - một lỗ hổng đáng chú ý là bản demo KiCad của mô hình đã thu hút sự chú ý mới. Tất cả bảng xếp hạng, phương pháp và trình khám phá kết quả mẫu của điểm chuẩn đều được công khai và các phòng thí nghiệm có thể chạy mô hình của riêng họ.

Những gì nó không đo lường được - Tuy nhiên

EEBench V1 chỉ bao gồm thiết kế analog và kỹ thuật số thông qua mô phỏng. Nó vẫn chưa kiểm tra xem một mô hình có thể bố trí một bảng vật lý, sản xuất nó hoặc tạo ra một sản phẩm hoàn chỉnh hay không - những giai đoạn xuất hiện các chế độ lỗi hoàn toàn mới. Nhóm cho biết họ muốn thêm các giai đoạn đó sau, nhưng tập trung phiên bản 1 vào vòng xác minh yêu cầu-thiết kế vì đó là nơi công việc kỹ thuật hữu ích có thể được phân loại một cách khách quan.

Tuy nhiên, điểm chuẩn đã đến vào thời điểm đáng chú ý. Một phòng thí nghiệm của Frontier hiện trích dẫn nó trong một thẻ mô hình, ra mắt các bản demo đưa thiết bị điện tử lên trang nhất và điểm số cao nhất - 61,6% - cho thấy các mô hình có khả năng hoạt động đáng kể trong khi vẫn chưa đáng tin cậy. Đối với các kỹ sư điện đang theo dõi, thông điệp từ kết quả EEBench đầu tiên sẽ được đo lường: AI ngày càng có thể thiết kế các mạch trên giấy. Liệu chúng có tồn tại khi tiếp xúc với các bộ phận thực hay không chính là điều mà tiêu chuẩn này tồn tại để tìm hiểu.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →