Cuando OpenAI presentó el GPT-6 Astra esta semana, una demostración llamó especialmente la atención de una audiencia que rara vez recibe un reconocimiento en los lanzamientos de modelos fronterizos: los ingenieros eléctricos. La publicación de lanzamiento presentó al modelo diseñando una placa de circuito en KiCad, la herramienta de diseño electrónico de código abierto. Pero un pequeño equipo de ingenieros ha estado planteando una pregunta más difícil: no si los modelos de IA pueden operar software electrónico, sino si los circuitos que producen realmente funcionan.

Su respuesta llegó el 4 de septiembre en forma de EEBench, un nuevo punto de referencia público que clasifica circuitos diseñados por IA utilizando simulaciones deterministas de SPICE en lugar de juicio humano. Los primeros resultados sugieren que los modelos actuales saben mucho más sobre electrónica de lo que normalmente muestran sus resultados, pero aun así fallan en el tipo de comportamiento de las piezas en el mundo real que también hace tropezar a los ingenieros humanos. Para más contexto sobre esta historia, consulta nuestra noticias de IA.

Por qué el diseño de circuitos necesitaba su propio punto de referencia

El equipo de EEBench, que publica el punto de referencia en eebench.org, dice que su experiencia muestra que los modelos actuales han absorbido libros de texto, hojas de datos, notas de aplicación y grandes cantidades de código. El cuello de botella es la interfaz. Cuando un agente opera una herramienta gráfica CAD como KiCad, dedica gran parte de su esfuerzo a hacer clic en los menús y seguir lo que está en la pantalla, consumiendo su ventana contextual con coordenadas y estado de la aplicación en lugar de razonamiento eléctrico.

EEBench adopta un enfoque diferente. Los circuitos en el punto de referencia están escritos en atopile, un lenguaje que describe la electrónica como código declarativo, por lo que el agente trabaja directamente en componentes, conexiones y restricciones. El modelo puede modificar un diseño, construirlo, ejecutar una simulación e inspeccionar fallas sin salir del proyecto. Según el equipo, esto funciona mucho mejor que pedirle a un modelo que dibuje líneas en una GUI, y permite que el punto de referencia pruebe el conocimiento de la electrónica en lugar de la habilidad de uso de la computadora.

Piezas reales, fallos reales

Una tarea pública se extrae de un contador de energía residencial. Cuando su suministro de 5 voltios desaparece, el circuito debe mantener activo el procesador durante otros 20 milisegundos para que pueda guardar las lecturas acumuladas, con el riel protegido permaneciendo por encima del umbral de caída de tensión de 3,0 voltios del procesador todo el tiempo.

La mayoría de los modelos, informa el equipo, llegan inmediatamente a la conclusión básica correcta: agregar un condensador. El punto de referencia lo hace más difícil de lo que parece. Un condensador cerámico real puede ofrecer mucho menos que su capacitancia anunciada una vez que se le aplica voltaje, las piezas tienen tolerancias y la capacitancia adicional agrega costos, ocupa espacio y ralentiza la recarga del riel cuando regresa la energía.

Los calificadores captaron una presentación que ilustra la brecha entre las respuestas de los libros de texto y el hardware funcional. Un diseño especificaba 22 microfaradios nominalmente, un valor que parece suficiente sobre el papel. Pero con 4,7 voltios de polarización, el graduador midió sólo 11,4 microfaradios de capacitancia efectiva, muy por debajo del requisito de 545 microfaradios de la tarea. El código fuente se construyó con éxito. El circuito aún falla: la simulación mostró que el riel protegido cayó por debajo del requisito de 3 voltios después de solo 0,85 milisegundos, ni cerca de los 20 requeridos.

Las tareas más difíciles llegan más lejos. Una asignación analógica requiere sintetizar un filtro de paso bajo de retroalimentación múltiple alrededor de un amplificador operacional, resolver relaciones de resistencia y capacitor para los polos requeridos y mantener la ganancia, la frecuencia de corte y Q dentro de los límites, incluso cuando cada componente se lleva a las esquinas de tolerancia del peor de los casos.

Cómo funciona la calificación

Las comprobaciones de EEBench son totalmente deterministas. El arnés construye el diseño presentado, construye el gráfico del circuito y la lista de materiales, y ejecuta un conjunto de simulaciones SPICE y comprobaciones de diseño, donde cada requisito produce una medición frente a un límite numérico. Las tareas miden la ganancia, los umbrales, la onda, la respuesta transitoria y el comportamiento en las esquinas de tolerancia de los componentes. La puntuación técnica se combina con una medida de rentabilidad frente a una lista de materiales de referencia, aunque el coste sólo ayuda una vez que el circuito funciona.

El equipo compara la configuración con darle a un agente de codificación un compilador y un conjunto de pruebas, excepto que las pruebas miden voltajes y el comportamiento de los componentes. Todas las tareas de la versión 1 utilizan piezas de fabricantes reales, con especificaciones extraídas de hojas de datos y trasladadas a los modelos de simulación, lo que obliga al agente a encontrar combinaciones que existan, que se puedan pedir y que tengan un precio razonable.

La primera tabla de clasificación

Los resultados del 1 de septiembre sitúan a Claude Opus 5 en la cima del EEBench V1 con un 61,6 % en 13 tareas. Grok 4.6 quedó en segundo lugar con un 57,1%, justo por delante de Claude Fable 5.1 con un 56,4%. Claude Fable 5 obtuvo un 54,3% y Claude Opus 4.8 Max un 51,4%. El equipo señala que hace unos meses no habría esperado que los modelos tuvieran un rendimiento tan bueno.

Un resultado agradó especialmente al equipo: xAI incluyó EEBench en la tarjeta de modelo Grok 4.6, en una sección sobre aceleración de ingeniería junto con modelado 3D y evaluaciones CAD paramétricas. La propia ejecución publicada de xAI obtuvo una puntuación de Grok de 4,6 con un 60,0 % con un alto esfuerzo de razonamiento. Según los materiales de lanzamiento de xAI, el modelo recibió datos de ingeniería de alta calidad y capacitación de aprendizaje reforzado en entornos de dominios específicos, incluido el diseño asistido por computadora.

Los modelos de OpenAI probados hasta ahora se encuentran más abajo en la tabla: GPT-5.5 obtuvo un 42,3% y GPT-5.6 Sol un 39,4%. Aún no hay resultados del GPT-6 Astra, una brecha notable dado que la demostración KiCad del modelo despertó una atención renovada. La tabla de clasificación, la metodología y el explorador de resultados de muestra del punto de referencia son públicos y los laboratorios pueden ejecutar sus propios modelos.

Lo que aún no mide

EEBench V1 cubre el diseño analógico y digital únicamente mediante simulación. Aún no prueba si un modelo puede diseñar una placa física, fabricarla o generar un producto terminado, etapas en las que aparecen modos de falla completamente nuevos. El equipo dice que quiere agregar esas etapas más adelante, pero centró la versión 1 en el ciclo de requisitos-diseño-verificación porque es allí donde el trabajo de ingeniería útil ya se puede calificar objetivamente.

Aún así, el punto de referencia llega en un momento revelador. Un laboratorio de vanguardia ahora lo cita en una tarjeta modelo, las demostraciones de lanzamiento colocan la electrónica en la portada y la puntuación más alta (61,6%) muestra que los modelos se vuelven significativamente capaces sin dejar de ser confiables. Para los ingenieros eléctricos que observan, el mensaje de los primeros resultados de EEBench es evidente: la IA puede diseñar cada vez más circuitos en papel. Si sobreviven al contacto con piezas reales es precisamente lo que pretende averiguar este punto de referencia.

---

Mantente al Día con la IA

Las últimas noticias, análisis y avances de inteligencia artificial, en un solo lugar.

Leer más noticias de IA →