Även den senaste generationen av resonemang-kapabla AI-modeller reproducerar ras- och könsstereotyper när de tillfrågas om medicinska scenarier, enligt ny forskning från australiensiska forskare. Fynden, som rapporterades den 7 augusti 2026, är en nykter påminnelse om att uppskalning av modellintelligens inte automatiskt eliminerar de systemiska fördomar som är inbäddade i träningsdata. För fler brytande AI-nyheter om skärningspunkten mellan artificiell intelligens och rättvisa inom hälsovården, väcker studien brådskande frågor om hur dessa verktyg ska användas i kliniska miljöer.

Testar nästa generations resoneringsmodeller

Forskare frågade två nästa generations resonerande stora språkmodeller, OpenAI:s o3-mini och DeepSeek-R1, om fiktiva patienter för att bedöma om nyare modeller har övervunnit de väldokumenterade fördomarna hos sina föregångare. Resoneringsmodeller, som ägnar ytterligare beräkningar åt att "tänka" igenom problem innan de svarar, anses generellt vara mer kapabla än vanliga chatbots vid komplexa uppgifter. Antagandet har varit att denna extra förmåga också kan göra dem mer tillförlitliga inom känsliga områden som medicin.

Resultaten tyder på annat. Studien fann att båda modellerna reproducerade ras- och könsstereotyper när de presenterades med kliniska scenarier, vilket tyder på att språnget från standardarkitekturer till resonerande arkitekturer inte har löst det grundläggande problemet med partisk träningsdata.

Ett ihållande problem över generationer

Fynden överensstämmer med en växande mängd bevis för att medicinsk fördom i AI är envist ihållande. En systematisk litteraturöversikt publicerad i Nature i april 2026 undersökte partiskhet, representation och klinisk trohet i AI-genererade bilder som används för medicinsk utbildning. Den granskningen fann en utbredd underrepresentation av vissa demografiska grupper och stereotypa skildringar när de dök upp.

I maj 2026 publicerade The Lancet en omfattande granskning av rättvisa mätvärden för AI-baserade kliniska förutsägelsemodeller. Den analysen visade att även om forskare har föreslagit många matematiska ramverk för att mäta rättvisa, tillämpas mätvärdena inkonsekvent över studier, vilket gör det svårt att bedöma om verkliga framsteg görs.

Den australiska studien lägger till en ny dimension genom att fokusera specifikt på resonemangsmodeller, kategorin AI som många trodde skulle vara mer robust mot partiskhet på grund av deras strukturerade problemlösningsstrategi.

Varför resonemang inte eliminerar partiskhet

Den ihållande bias i resonemangsmodeller pekar på en strukturell fråga i hur dessa system lär sig. Stora språkmodeller tränas på stora korpus av text, varav mycket återspeglar fördomar, stereotyper och ojämlikheter som finns i den verkliga världen. Medicinsk litteratur i sig har historiskt sett överrepresenterat vita manliga patienter i kliniska prövningar och underrepresenterat kvinnor och rasminoriteter.

Resoneringsmodeller förbättrar prestandan på logik- och flerstegsproblem genom att generera mellanliggande resonemangssteg, men dessa resonemangssteg produceras fortfarande av samma underliggande modell tränad på samma data. Om modellen har lärt sig samband mellan vissa demografiska grupper och vissa medicinska tillstånd eller personlighetsdrag, kan den reproducera dessa associationer även när den "resonerar" genom ett kliniskt scenario.

Detta betyder att den kliniska troheten hos en modell, dess förmåga att producera korrekta, rättvisa medicinska resultat, inte bara beror på resonemangsarkitektur utan på representativiteten och kvaliteten på de data som den tränades på.

The Stakes for Healthcare AI

Fynden kommer i ett ögonblick då AI snabbt inbäddas i sjukvårdens infrastruktur. Sjukhus och hälsosystem använder AI för uppgifter som sträcker sig från klinisk dokumentation och medicinsk bildanalys till patienttriage och behandlingsrekommendationer. HCPLive-nätverket rapporterade i augusti 2026 om farhågor om att AI skulle kunna förvärra skillnaderna i sjukvården om partiska modeller implementeras utan tillräcklig tillsyn.

Om resonemangsmodeller fortfarande återger stereotyper om ras och kön när de tillfrågas om patienter, är risken att dessa verktyg kan förstärka befintliga skillnader i diagnos, behandlingsrekommendationer och patientkommunikation. En modell som systematiskt associerar vissa tillstånd med vissa demografiska grupper, eller som behandlar patienter olika baserat på ras eller kön, kan orsaka verklig skada i kliniska miljöer.

Eurasia Review, som rapporterar om studien, noterade att den ihållande bias över modellgenerationer tyder på att AI-industrins tillvägagångssätt för att ta itu med medicinsk bias kan behöva skifta från förbättringar av modellarkitektur till datastyrning och representationsrättvisa.

Vad behöver ändras

Forskningen pekar på flera nödvändiga förändringar. För det första måste utbildningsdata för medicinsk AI granskas för representativ rättvisa, för att säkerställa att kvinnor, rasminoriteter och andra underrepresenterade grupper återspeglas på ett adekvat sätt. För det andra bör rättvisetestning vara ett obligatoriskt steg innan AI implementeras i kliniska miljöer, inte en eftertanke. För det tredje behöver det medicinska samfundet standardiserade riktmärken för att utvärdera om modeller behandlar patienter rättvist över demografiska grupper.

Lancet-omfattningsgranskningens slutsats att rättvisa mätvärden tillämpas inkonsekvent belyser behovet av standardiserade utvärderingsramverk. Utan enighet om hur man mäter partiskhet är det omöjligt att hålla AI-utvecklare ansvariga eller att spåra om framsteg görs.

En uppmaning till försiktighet

Den australiensiska studien fungerar som en varning för att anta att mer kapabla modeller är säkrare i sig. Eftersom resonemangsmodeller blir standard för tillämpningar med hög insats inom medicin, juridik och finans, tyder de medicinska bias-fynden på att rå förmåga och rättvisa är separata problem som kräver separata lösningar.

För hälso- och sjukvårdsorganisationer som överväger AI-utbyggnad är budskapet tydligt: ​​även de mest avancerade resonemangsmodellerna som finns tillgängliga idag kan reproducera skadliga stereotyper, och den risken måste hanteras aktivt genom testning, tillsyn och ett engagemang för rättvisa data.

Ligg före AI

När AI blir inbäddad i vården är det lika viktigt att förstå dess begränsningar som att fira dess förmåga. Följ vår pågående AI-industribevakning för att hålla jämna steg med den senaste AI-utvecklingen inom medicinsk forskning, modellsäkerhet och hälsoteknik.

Läs mer AI-nyheter →