אפילו הדור האחרון של מודלים בעלי יכולת היגיון בינה מלאכותית משחזרים סטריאוטיפים גזעיים ומגדריים כשנשאלים על תרחישים רפואיים, על פי מחקר חדש של מדענים אוסטרלים. הממצאים, שדווחו ב-7 באוגוסט 2026, הם תזכורת מפוכחת לכך שהגדלת אינטליגנציה של מודלים אינה מבטלת אוטומטית את ההטיות המערכתיות המוטבעות בנתוני האימונים. לעוד חדשות בינה מלאכותית על ההצטלבות של בינה מלאכותית והון עצמי בתחום הבריאות, המחקר מעלה שאלות דחופות לגבי פריסת כלים אלה בסביבה קלינית.

בדיקת הדור הבא של מודלים להיגיון

חוקרים שאלו שני מודלים של שפות חשיבה גדולות מהדור הבא, o3-mini של OpenAI ו-DeepSeek-R1, על מטופלים בדיוניים כדי להעריך אם מודלים חדשים יותר התגברו על ההטיות המתועדות היטב של קודמיהם. מודלים של הנמקה, המוציאים חישוב נוסף ב"חשיבה" על בעיות לפני מתן מענה, נחשבים בדרך כלל ליכולים יותר מצ'אטבוטים סטנדרטיים במשימות מורכבות. ההנחה הייתה שהיכולת הנוספת הזו עשויה גם להפוך אותם לאמינים יותר בתחומים רגישים כמו רפואה.

התוצאות רומזות אחרת. המחקר מצא ששני המודלים שיחזרו סטריאוטיפים גזעיים ומגדריים כשהוצגו בפני תרחישים קליניים, מה שמצביע על כך שהקפיצה מארכיטקטורות סטנדרטיות לארכיטקטורות חשיבה לא פתרה את הבעיה הבסיסית של נתוני אימון מוטים.

בעיה מתמשכת לאורך דורות

הממצאים עולים בקנה אחד עם עדות הולכת וגדלה לכך שהטיה רפואית ב-AI מתמשכת בעקשנות. סקירת ספרות שיטתית שפורסמה ב-Nature באפריל 2026 בחנה הטיה, ייצוג ונאמנות קלינית בתמונות שנוצרו על ידי AI המשמשות לחינוך רפואי. סקירה זו מצאה תת-ייצוג נרחב של קבוצות דמוגרפיות מסוימות והצגות סטריאוטיפיות כשהן הופיעו.

במאי 2026, The Lancet פרסם סקירה מקיפה של מדדי הוגנות עבור מודלים חיזויים קליניים מבוססי בינה מלאכותית. ניתוח זה מצא כי בעוד שחוקרים הציעו מסגרות מתמטיות רבות למדידת הוגנות, המדדים מיושמים באופן לא עקבי על פני מחקרים, מה שמקשה להעריך אם מתבצעת התקדמות אמיתית.

המחקר האוסטרלי מוסיף מימד חדש על ידי התמקדות ספציפית במודלים של חשיבה, קטגוריית הבינה המלאכותית שרבים האמינו שתהיה חזקה יותר נגד הטיה בגלל הגישה המובנית שלהם לפתרון בעיות.

מדוע נימוק אינו מבטל הטיה

ההתמדה של הטיה במודלים של חשיבה מצביעה על בעיה מבנית באופן שבו מערכות אלו לומדות. מודלים של שפה גדולים מאומנים על קורפוסים עצומים של טקסט, שחלק גדול מהם משקף את ההטיות, הסטריאוטיפים ואי השוויון הקיימים בעולם האמיתי. הספרות הרפואית עצמה ייצגה באופן היסטורי מטופלים גברים לבנים בניסויים קליניים וייצוג נמוך של נשים ומיעוטים גזעיים.

מודלים של הנמקה משפרים את הביצועים בבעיות לוגיקה ורב-שלביות על ידי יצירת שלבי הגיון ביניים, אך שלבי ההיגיון הללו עדיין מיוצרים על ידי אותו מודל בסיסי מאומן על אותם נתונים. אם המודל למד קשרים בין קבוצות דמוגרפיות מסוימות לבין מצבים רפואיים מסוימים או תכונות אישיות, הוא יכול לשחזר את הקשרים הללו גם תוך כדי "היגיון" באמצעות תרחיש קליני.

משמעות הדבר היא שהנאמנות הקלינית של מודל, יכולתו לייצר תפוקות רפואיות מדויקות ושוויוניות, תלויות לא רק בארכיטקטורת ההיגיון אלא בייצוגיות ובאיכות הנתונים שעל פיהם הוא הוכשר.

ההימור על AI בתחום הבריאות

הממצאים מגיעים ברגע שבו AI מוטבע במהירות בתשתית שירותי בריאות. בתי חולים ומערכות בריאות פורסים בינה מלאכותית למשימות הנעות מתיעוד קליני וניתוח הדמיה רפואית ועד בדיקה של חולים והמלצה לטיפול. רשת HCPLive דיווחה באוגוסט 2026 על חששות שבינה מלאכותית עלולה להחמיר את פערי שירותי הבריאות אם ייפרסו מודלים מוטים ללא פיקוח הולם.

אם מודלים של חשיבה עדיין משחזרים סטריאוטיפים לגבי גזע ומגדר כשנשאלים על מטופלים, הסיכון הוא שכלים אלה יכולים לחזק את הפערים הקיימים באבחון, בהמלצות הטיפול ובתקשורת המטופלים. מודל שמקשר באופן שיטתי מצבים מסוימים לקבוצות דמוגרפיות מסוימות, או שמתייחס למטופלים בצורה שונה על סמך גזע או מין, עלול לגרום לנזק ממשי במסגרות קליניות.

ה-Eurasia Review, המדווח על המחקר, ציין כי התמשכות ההטיה בין דורות המודל מעידה על כך שהגישה של תעשיית הבינה המלאכותית להתמודדות עם הטיה רפואית עשויה להזדקק משיפורי ארכיטקטורת המודל לממשל נתונים והון ייצוגי.

מה צריך לשנות

המחקר מצביע על מספר שינויים הכרחיים. ראשית, יש לבחון נתוני הכשרה עבור בינה מלאכותית רפואית לצורך שוויון ייצוגי, על מנת להבטיח שנשים, מיעוטים גזעיים וקבוצות אחרות מיוצגות בתת-ייצוג ישתקפו כראוי. שנית, בדיקת הוגנות צריכה להיות שלב חובה לפני פריסת AI במסגרות קליניות, ולא מחשבה שלאחר מכן. שלישית, הקהילה הרפואית זקוקה לאמות מידה סטנדרטיות כדי להעריך האם מודלים מטפלים בחולים באופן שוויוני בין קבוצות דמוגרפיות.

הממצא של סקירת ההיקף של Lancet כי מדדי הוגנות מיושמים באופן לא עקבי מדגיש את הצורך במסגרות הערכה סטנדרטיות. ללא הסכמה כיצד למדוד הטיה, אי אפשר להטיל אחריות על מפתחי בינה מלאכותית או לעקוב אחר התקדמות.

קריאה לזהירות

המחקר האוסטרלי משמש אזהרה מפני הנחה שדגמים בעלי יכולת גבוהה יותר הם בטוחים יותר מטבעם. כאשר מודלים של חשיבה הופכים לברירת המחדל עבור יישומים עתירי סיכון ברפואה, משפטים ופיננסים, ממצאי ההטיה הרפואית מצביעים על כך שהיכולת הגולמית וההון העצמי הם בעיות נפרדות הדורשות פתרונות נפרדים.

עבור ארגוני בריאות השוקלים פריסת בינה מלאכותית, המסר ברור: אפילו דגמי ההיגיון המתקדמים ביותר הקיימים כיום יכולים לשחזר סטריאוטיפים מזיקים, ויש לנהל את הסיכון הזה באופן אקטיבי באמצעות בדיקות, פיקוח ומחויבות לנתונים הוגנים.

הישאר לפני AI

כאשר בינה מלאכותית הופכת להיות מוטבעת בשירותי הבריאות, הבנת המגבלות שלה חשובה לא פחות מאשר לחגוג את היכולות שלה. כדי להתעדכן בפיתוחי הבינה המלאכותית העדכנית ביותר במחקר רפואי, בטיחות מודלים וטכנולוגיית בריאות, עקוב אחר [סיקור תעשיית הבינה המלאכותית] (https://aibuzzwire.news) המתמשך שלנו.

קרא עוד חדשות AI →