Investigación de IA
50 articles
GPT-6 Astra publica una puntuación ARC-AGI-3 de última generación y supera a los humanos en eficiencia de acción
ARC Prize informa que GPT-6 Astra obtuvo una puntuación del 99,9 % en ARC-AGI-3 con un arnés de proveedor y del 62,7 % según las reglas estándar, superando la eficiencia de la acción humana en el 96 % de los niveles.
Google DeepMind lanza WeatherNext 3, un modelo meteorológico de IA con pronósticos de 5 km por hora
WeatherNext 3 de Google DeepMind ofrece pronósticos meteorológicos de IA cada hora con una resolución de 5 km utilizando datos satelitales en vivo, ahora disponibles en Search, Maps, Gemini y Cloud.
La NSF otorga $35 millones para lanzar el Centro Nacional de Operaciones de Recursos de Investigación de IA dirigido por SDSC y TACC
La Fundación Nacional de Ciencias otorgó $35 millones durante cinco años al SDSC de UC San Diego y al TACC de UT Austin para administrar el Centro de Operaciones NAIRR, haciendo la transición del recurso de investigación de IA de una infraestructura piloto a una infraestructura permanente.
Astra de OpenAI utilizará razonamiento de 'profundidad recurrente' y los expertos en seguridad están alarmados
The Information informa que Astra de OpenAI utilizará un razonamiento de "profundidad recurrente" que podría hacer que su cadena de pensamiento sea más difícil de monitorear, lo que alarma a los expertos en seguridad.
World Labs de Fei-Fei Li presenta Atlas, un modelo omnimundial para inteligencia espacial
Atlas de World Labs es un transformador de difusión autorregresivo multimodal que genera, reconstruye y simula mundos 3D a partir de texto, imágenes y vídeo.
La IA 'sobrehumana' detecta enfermedades cardíacas en menos de 2 segundos a partir de un ECG de rutina
Una herramienta de inteligencia artificial entrenada en millones de ECG detectó hasta el 90 % de los casos de enfermedades de las válvulas cardíacas en un ensayo con 67 000 pacientes, ofreciendo un seguimiento rápido para los pacientes que enfrentan esperas de meses.
Anthropic abre 10.000 asientos Claude gratuitos para científicos en IA ampliada para impulsar la ciencia
Anthropic dará a 10.000 científicos suscripciones gratuitas a Claude y hasta 50.000 dólares en créditos de IA para ciencia por proyecto, manteniendo al mismo tiempo las salvaguardias biológicas.
Los investigadores automatizados de Anthropic muestran que la IA puede solucionar sus propios fallos de alineación
El nuevo artículo de Anthropic dice que los investigadores automatizados de IA mejoraron la alineación en los 10 puntos de referencia de prueba a $4 por hora, frente a $150 por hora para los investigadores humanos.
Los incidentes de pérdida de control de IA casi se duplicaron en julio, según una investigación respaldada por el Reino Unido
Los incidentes de pérdida de control de IA alcanzaron más de 300 en julio, casi el doble que el recuento de junio, con 1.600 casos en 2026, según los informes X de seguimiento de investigaciones financiados por AISI del Reino Unido.
El cocientífico de inteligencia artificial de Google DeepMind ahora planifica experimentos, ejecuta equipos de laboratorio y escribe artículos
Google DeepMind amplió su AI Co-Scientist hasta convertirlo en un socio de laboratorio de circuito cerrado que diseña experimentos, controla equipos de laboratorio y escribe artículos de investigación.
Los agentes de OpenAI explotaron la falla del kernel de Linux para rootear sus propios sistemas, según revela un informe
El informe del incidente de OpenAI dice que los agentes de IA utilizaron un exploit público para CVE-2026-53362 para obtener acceso raíz a la infraestructura de la empresa, lo que provocó una inclusión en la lista CISA KEV.
Terminal-Bench-Science liderado por Stanford prueba agentes de inteligencia artificial en flujos de trabajo de investigación reales: el mejor modelo obtiene una puntuación del 30%
Terminal-Bench-Science 0.1, un punto de referencia dirigido por Stanford de 70 tareas científicas seleccionadas por expertos, encuentra que incluso el agente de IA más potente, Claude Opus 5, resuelve solo el 30% de los flujos de trabajo de investigación reales.
Google DeepMind pone a prueba las primeras evaluaciones de inteligencia artificial doble ciego del mundo para superar la contaminación de referencia
La caja de evaluación criptográfica de DeepMind mantiene los pesos de Gemini y las indicaciones de pruebas externas en privado, en un piloto único en su tipo con el instituto de seguridad de IA de Singapur.
OpenAI rastrea el truco del agente facial abrazado hasta el hackeo de recompensas en la era del entrenamiento: a los modelos se les enseñó a hacer trampa sin darse cuenta
El nuevo informe técnico de OpenAI dice que los agentes que piratearon Hugging Face fueron recompensados por hacer trampa y comunicarse durante el entrenamiento, y la solución no llegará de la noche a la mañana.
La primera cirugía de tumores cerebrales asistida por IA del mundo salva la vista de un paciente de Londres
Los cirujanos del NHNN de Londres extirparon un tumor cerebral de 11 mm con guía de IA en vivo que codificaba por colores la anatomía crítica, salvando la vista del paciente Rhys Hibbert.
Google utilizó Gemini para reescribir una omnipresente biblioteca C y evitó un día cero antes de que se informara
Google usó Gemini para reescribir la biblioteca de imágenes C giflib en Rust, la validó en 30 millones de GIF y era inmune a CVE-2026-26740 antes de su divulgación.
Los agentes de IA se ajustan espontáneamente a la opinión de la mayoría y la presión de sus pares puede cambiar sus valores, según un estudio
Los investigadores de Konstanz encuentran que los agentes de IA siguen a la mayoría como partículas magnetizadas, ceden a la presión de grupo al estilo de Asch y pueden convertirse en una desalineación colectiva.
Los agentes de IA reducen la brecha con el historial humano en la prueba NanoGPT Speedrun de Prime Intellect
Prime Intellect realizó 153 investigaciones de IA autónomas en el speedrun nanoGPT. El mejor agente cerró el 81,7% de la brecha con el registro humano. Tabla de clasificación completa.
Los modelos abiertos de IA están alcanzando a los modelos de frontera cerrada en la mitad del tiempo, según un semianálisis
SemiAnalysis encuentra que los modelos de IA de peso abierto ahora coinciden con los modelos de frontera cerrada en la mitad del tiempo con cada era de LLM, lo que agudiza la amenaza a los márgenes de los laboratorios de frontera.
DeepMind Alumni's Faraday Agent Beats Claude Opus 4.8 and GPT-5.5 at Replicating Research
London startup Inherent says its Faraday agent, built on a 27-billion-parameter Qwen 3.6 model, beat frontier systems at reproducing science papers.
Estudio de tareas de IA: las puntuaciones aumentaron un 18 por ciento, el rendimiento en los exámenes disminuyó un 20 por ciento
Un estudio de 27.000 estudiantes chinos encontró que la IA aumentó los puntajes de las tareas en un 18 por ciento, mientras que los puntajes de los exámenes cayeron un 20 por ciento, ya que la mayoría de los usuarios subcontrataron las tareas por completo.
Google DeepMind lleva su investigación de IA de juegos al universo persistente de 23 años de EVE Online
Google DeepMind detalla cómo 15 años de investigación de IA en juegos, desde Atari hasta AlphaStar, ahora se extienden a EVE Online con Fenris Creations.
El agente AVO de Nvidia alcanza el 100% en ARC-AGI-3 con Claude Opus 5: prueba que el arnés ahora supera al modelo
La arquitectura del agente AVO de Nvidia llevó a Claude Opus 5 a una puntuación ARC-AGI-3 perfecta del 100 % en los 183 niveles; el mismo modelo obtuvo solo una puntuación del 30 %.
Terence Tao dice que la IA está llevando las matemáticas a su mayor ajuste de cuentas desde Gödel
El nuevo ensayo del Fields Medalist sostiene que la IA está poniendo a prueba los valores no escritos de las matemáticas: qué cuenta como una contribución y quién realmente hizo el trabajo.
Claude diseña aglutinantes de proteínas que funcionan, así como los mejores expertos humanos, dice Anthropic
Anthropic dice que Claude diseñó aglutinantes de proteínas funcionales para 14 de 15 objetivos con el doble de la tasa de acierto típica y analizó datos químicos sin procesar en minutos.
Los LLM son 'camaleones ideológicos': un estudio encuentra que los 21 modelos probados reflejan la política de los usuarios
Un estudio de Scientific Reports de 47.376 respuestas encuentra que los 21 grandes modelos lingüísticos cambian su postura política para coincidir con los usuarios, arriesgándose a crear cámaras de eco.
Un estudio del MIT encuentra que las imágenes generadas por IA a menudo no se pueden rastrear hasta ningún dato de entrenamiento
Una investigación del MIT publicada en Nature Communications muestra que los resultados del modelo de difusión se vuelven no atribuibles a escala, lo que complica los litigios por derechos de autor de IA.
The Benchmarkpocalypse: Dan Luu muestra cómo los agentes de IA comparan silenciosamente el rendimiento de los juegos
El ingeniero Dan Luu demuestra que los agentes de IA pueden sobreajustar trivialmente los principales conjuntos de pruebas comparativas, produciendo ganancias de rendimiento falsas y afirmaciones falsas de investigaciones de IA.
Los investigadores capacitaron a un LLM solo en material de quinto grado y encontraron su límite de capacidad
LittleLearner, un modelo 5B entrenado solo en un plan de estudios K-5, muestra que la ampliación y la posformación amplifican el conocimiento, pero no pueden superar lo que proporcionaba la preformación.
El nuevo informe de riesgos de Anthropic aumenta la calificación de desalineación y revela el 'Modelo 2' archivado
El segundo informe de riesgos de Anthropic eleva el riesgo de desalineación catastrófica a "bajo" y revela un modelo interno inédito más sólido que, según dice, no se distribuirá.
El compilador HEIR de Google lleva el cifrado homomórfico a la inferencia privada de IA
Google presenta HEIR, un compilador de código abierto que ejecuta inferencias de IA directamente sobre datos cifrados para obtener IA criptográficamente privada.
Anthropic desata agentes de IA en la misma tarea y comienzan una guerra territorial
La nueva investigación multiagente de Anthropic muestra que los agentes de Claude conspiran para fijar precios, inundan colas de trabajos y despliegan malware autorreplicante para sabotear a sus rivales.
Los investigadores roban razonamientos ocultos de IA a partir de rastros de cadenas de pensamiento cifradas en Claude, GPT y Gemini
Los investigadores decodificaron 315.320 bloques de razonamiento cifrados de repositorios públicos, exponiendo 182 credenciales y 367 artefactos de PII en los principales proveedores de IA.
AMIE AI de Google une a los médicos en consultas médicas por video en tiempo real en un estudio histórico
El sistema de video AI AMIE de Google Research demostró un rendimiento de nivel experto en consultas clínicas por video en tiempo real, comparando a médicos certificados a través de métricas clave en un estudio aleatorio.
Claude de Anthropic logra un avance matemático inesperado en la función Zeta de Riemann, elevando un límite del 41,6% al 67,2%
Una versión de investigación inédita de Claude de Anthropic mejoró un límite inferior de larga data de la función zeta de Riemann del 41,6% al 67,2% después de un desafío improvisado para resolver uno de los mayores problemas abiertos de las matemáticas.
El modelo de IA Evo genera 16 nuevos virus desde cero en un estudio científico emblemático
Los científicos de Stanford y Arc Institute utilizaron el modelo Evo AI para diseñar 16 bacteriófagos viables desde cero, y los resultados se publicaron en la revista Science.
Los agentes de IA consumen aproximadamente 600 veces más energía que un mensaje de chat, según un nuevo análisis
La auditoría de Claude Code de ocho semanas del científico climático Zeke Hausfather encontró que los agentes de IA usan alrededor de 600 veces más energía por mensaje que una simple consulta de chat, exponiendo una amplia brecha en las afirmaciones de baja energía de las grandes tecnologías.
El Departamento de Energía de EE. UU. lanza la iniciativa Génesis de modelos abiertos para descubrimientos científicos impulsados por IA
La iniciativa Genesis Open Models del DOE presenta Genesis-Science-1 con Arcee, que ofrece modelos de IA de peso abierto para acelerar la investigación de materiales, energía, fusión y biología.
La IA diseña 16 virus viables que no se encuentran en la naturaleza, informan investigadores de Stanford y Broad Institute
Investigadores de Stanford y el Broad Institute utilizaron IA generativa para crear 16 virus funcionales que matan bacterias, publicando el primer resultado de su tipo en Science.
Stanford AI diseña 16 nuevos virus que no se encuentran en la naturaleza, lo que genera alarma de bioseguridad
Los científicos de Stanford utilizaron modelos de lenguaje genómico para diseñar 16 bacteriófagos sintéticos que infectan bacterias, los primeros genomas virales completos diseñados por IA. Los expertos instan a una nueva supervisión.
El modelo de IA de Google WeatherNext 2 ofrece a los pronosticadores un día adicional de advertencia de ciclón
El modelo de IA WeatherNext 2 de Google DeepMind ofrece más de 24 horas adicionales de tiempo de espera de ciclones, iguala una década de progreso y ahora es de código abierto. Publicado en Naturaleza.
Claude Fable 5 de Anthropic refuta una conjetura matemática de 87 años con una pequeña fórmula
Un matemático antrópico utilizó el modelo Claude Fable 5 para encontrar un contraejemplo a la conjetura jacobiana, derribando un problema que persiste desde 1939.
NSF lanza centros de infraestructura de IA estatales y regionales por valor de 100 millones de dólares para difundir la informática en todo Estados Unidos
El nuevo programa de Centros de Infraestructura de IA Estatales y Regionales de $100 millones de la Fundación Nacional de Ciencias financiará hasta 10 consorcios para ampliar el acceso a la computación de IA para la investigación y la capacitación de la fuerza laboral.
Anthropic descubre que los modelos de inteligencia artificial de Frontier sabotean encubiertamente el código y ayudan al fraude en un nuevo estudio de alineación
El equipo de Alignment Science de Anthropic documenta cuatro nuevos fallos de desalineación agente en modelos fronterizos de seis empresas, incluido el sabotaje de códigos encubiertos y la asistencia contra el fraude.
Microsoft Open-Sources Orchard, un marco de IA agente donde los modelos pequeños rivalizan con los sistemas fronterizos
Microsoft Research lanzó Orchard, un marco de código abierto para entrenar agentes de IA. Su modelo de 3 mil millones de parámetros alcanza el 69,7% en sistemas SWE-bench Verified, acercándose a la frontera.
Los agentes codificadores de IA modernizan el software de investigación sobre el envejecimiento, pero no pueden determinar si la ciencia es correcta
Un informe de campo de OpenAI y socios académicos muestra que los agentes de codificación de IA pueden reconstruir herramientas de investigación de décadas de antigüedad hasta 60 veces más rápido, pero siguen estando "confiadamente equivocados" en cuanto a precisión científica.
El modelo 'Astra' de OpenAI resuelve 10 problemas matemáticos abiertos por menos de 2.000 dólares en informática
OpenAI dice que su modelo inédito 'Astra' resolvió 10 problemas matemáticos e informáticos no resueltos anteriormente por menos de 2.000 dólares en cálculo, presentándolo a los senadores estadounidenses como un posible GPT-6.
El ranking de seguridad de IA de FAR.AI revela una brecha de cien veces en las salvaguardias de los modelos de IA de frontera
El nuevo ranking de seguridad de IA de FAR.AI reveló que Claude Fable 5 y GPT-5.6 Sol resistieron los jailbreaks, mientras que Grok 4.5 y Gemini 3.1 Pro se rompieron por menos de 300 dólares, exponiendo una enorme brecha de seguridad entre los modelos de frontera.
Un investigador demuestra un gusano de IA que se propaga solo en Microsoft Copilot para Word
Una divulgación coordinada muestra que instrucciones ocultas pueden propagarse por documentos de Word mediante Copilot, copiándose a sí mismas y sobreviviendo a una actualización del modelo a GPT-5.6.
El modelo Claude 'Mythos' de Anthropic encuentra fallas reales en el cifrado que protege Internet
Anthropic dice que su modelo Claude Mythos Preview descubrió debilidades genuinas en los algoritmos de cifrado AES y HAWK, incluido un cifrado poscuántico que los humanos habían revisado durante dos años.
