Incluso la última generación de modelos de IA con capacidad de razonamiento reproduce estereotipos raciales y de género cuando se les pregunta sobre escenarios médicos, según una nueva investigación de científicos australianos. Los hallazgos, informados el 7 de agosto de 2026, son un recordatorio aleccionador de que la ampliación de la inteligencia del modelo no elimina automáticamente los sesgos sistémicos incorporados en los datos de entrenamiento. Para obtener más noticias de última hora sobre IA sobre la intersección de la inteligencia artificial y la equidad en la atención médica, el estudio plantea preguntas urgentes sobre la implementación de estas herramientas en entornos clínicos.
Probando la próxima generación de modelos de razonamiento
Los investigadores preguntaron a dos modelos de lenguaje grande de razonamiento de próxima generación, o3-mini y DeepSeek-R1 de OpenAI, sobre pacientes ficticios para evaluar si los modelos más nuevos han superado los sesgos bien documentados de sus predecesores. Los modelos de razonamiento, que realizan cálculos adicionales para "pensar" los problemas antes de responder, generalmente se consideran más capaces que los chatbots estándar en tareas complejas. Se ha supuesto que esta capacidad adicional también podría hacerlos más fiables en ámbitos sensibles como la medicina.
Los resultados sugieren lo contrario. El estudio encontró que ambos modelos reproducían estereotipos raciales y de género cuando se les presentaban escenarios clínicos, lo que indica que el salto de las arquitecturas estándar a las de razonamiento no ha resuelto el problema fundamental de los datos de entrenamiento sesgados.
Un problema persistente a través de generaciones
Los hallazgos son consistentes con un creciente cuerpo de evidencia de que el sesgo médico en la IA es obstinadamente persistente. Una revisión sistemática de la literatura publicada en Nature en abril de 2026 examinó el sesgo, la representación y la fidelidad clínica en imágenes generadas por IA utilizadas para la educación médica. Esa revisión encontró una subrepresentación generalizada de ciertos grupos demográficos y representaciones estereotipadas cuando aparecían.
En mayo de 2026, The Lancet publicó una revisión del alcance de las métricas de equidad para los modelos de predicción clínica basados en IA. Ese análisis encontró que, si bien los investigadores han propuesto numerosos marcos matemáticos para medir la equidad, las métricas se aplican de manera inconsistente en todos los estudios, lo que dificulta evaluar si se están logrando avances reales.
El estudio australiano añade una nueva dimensión al centrarse específicamente en los modelos de razonamiento, la categoría de IA que muchos creían que sería más sólida contra los sesgos debido a su enfoque estructurado de resolución de problemas.
Por qué el razonamiento no elimina el sesgo
La persistencia del sesgo en los modelos de razonamiento apunta a un problema estructural en la forma en que aprenden estos sistemas. Los grandes modelos lingüísticos se entrenan en vastos corpus de texto, muchos de los cuales reflejan los prejuicios, estereotipos e inequidades presentes en el mundo real. Históricamente, la propia literatura médica ha sobrerrepresentado a pacientes varones blancos en los ensayos clínicos y ha subrepresentado a mujeres y minorías raciales.
Los modelos de razonamiento mejoran el rendimiento en problemas lógicos y de varios pasos al generar pasos de razonamiento intermedios, pero esos pasos de razonamiento aún son producidos por el mismo modelo subyacente entrenado con los mismos datos. Si el modelo ha aprendido asociaciones entre ciertos grupos demográficos y ciertas condiciones médicas o rasgos de personalidad, puede reproducir esas asociaciones incluso mientras "razona" a través de un escenario clínico.
Esto significa que la fidelidad clínica de un modelo, su capacidad para producir resultados médicos precisos y equitativos, depende no sólo de la arquitectura del razonamiento sino de la representatividad y la calidad de los datos con los que se entrenó.
Lo que está en juego para la IA sanitaria
Los hallazgos llegan en un momento en el que la IA se está integrando rápidamente en la infraestructura sanitaria. Los hospitales y los sistemas de salud están implementando IA para tareas que van desde la documentación clínica y el análisis de imágenes médicas hasta la clasificación de pacientes y la recomendación de tratamientos. La red HCPLive informó en agosto de 2026 sobre la preocupación de que la IA pudiera empeorar las disparidades en la atención médica si se implementan modelos sesgados sin una supervisión adecuada.
Si los modelos de razonamiento todavía reproducen estereotipos sobre raza y género cuando se les pregunta sobre los pacientes, el riesgo es que estas herramientas puedan reforzar las disparidades existentes en el diagnóstico, las recomendaciones de tratamiento y la comunicación con el paciente. Un modelo que asocie sistemáticamente ciertas condiciones con ciertos grupos demográficos, o que trate a los pacientes de manera diferente según su raza o género, podría causar un daño real en entornos clínicos.
Eurasia Review, al informar sobre el estudio, señaló que la persistencia del sesgo entre las generaciones de modelos sugiere que el enfoque de la industria de la IA para abordar el sesgo médico puede necesitar pasar de las mejoras de la arquitectura del modelo a la gobernanza de datos y la equidad representacional.
Qué necesita cambiar
La investigación apunta a varios cambios necesarios. En primer lugar, se deben auditar los datos de capacitación para la IA médica para determinar la equidad de representación, garantizando que las mujeres, las minorías raciales y otros grupos subrepresentados se reflejen adecuadamente. En segundo lugar, las pruebas de equidad deberían ser un paso obligatorio antes de implementar la IA en entornos clínicos, no una ocurrencia tardía. En tercer lugar, la comunidad médica necesita puntos de referencia estandarizados para evaluar si los modelos tratan a los pacientes de manera equitativa en todos los grupos demográficos.
El hallazgo de la revisión del alcance de Lancet de que las métricas de equidad se aplican de manera inconsistente resalta la necesidad de marcos de evaluación estandarizados. Sin un acuerdo sobre cómo medir el sesgo, es imposible responsabilizar a los desarrolladores de IA o hacer un seguimiento de si se están logrando avances.
Un llamado a la precaución
El estudio australiano sirve como advertencia contra la suposición de que los modelos más capaces son intrínsecamente más seguros. A medida que los modelos de razonamiento se convierten en los predeterminados para aplicaciones de alto riesgo en medicina, derecho y finanzas, los hallazgos sobre el sesgo médico sugieren que la capacidad bruta y la equidad son problemas separados que requieren soluciones separadas.
Para las organizaciones de atención médica que están considerando implementar IA, el mensaje es claro: incluso los modelos de razonamiento más avanzados disponibles en la actualidad pueden reproducir estereotipos dañinos, y ese riesgo debe gestionarse activamente mediante pruebas, supervisión y un compromiso con los datos equitativos.
Manténgase por delante de la IA
A medida que la IA se integra en la atención sanitaria, comprender sus limitaciones es tan importante como celebrar sus capacidades. Para mantenerse al día con los últimos avances de la IA en investigación médica, seguridad de modelos y tecnología sanitaria, siga nuestra [cobertura de la industria de la IA] (https://aibuzzwire.news) en curso.
Leer más noticias sobre IA →