מודלים של שפות בינה מלאכותית רגישים בצורה מסוכנת לשינויים עדינים באופן הצגת האפשרויות, ומגיבים לדחיפות מטעות בהרבה יותר חזק מאשר בני אדם, על פי מחקר חדש שפורסם ב-Proceedings of the National Academy of Sciences.

הממצאים מעוררים דאגות רציניות לגבי פריסת סוכני בינה מלאכותית לקבלת החלטות אוטונומיות בתרחישים בעולם האמיתי, מעסקאות פיננסיות ועד בחירות בתחום הבריאות. כפי שדיווח AI Buzz Wire, חברות ממצבות יותר ויותר סוכנים המונעים על ידי LLM לפעול בשם המשתמשים בסביבות מורכבות.

המחקר, בהובלת מנואל צ'רפ, דוקטורנט במעבדת המדיה של המכון הטכנולוגי של מסצ'וסטס, בדק 14 מודלים של שפות חדישים מחברות טכנולוגיה גדולות. הדגמים שנבדקו כללו גרסאות של משפחות GPT-3.5, GPT-4 ו-GPT-5 של OpenAI, דגמי קלוד 3 ו-4.5 של Anthropic ודגמי Gemini 1.5 ו-2.5 של גוגל.

איך עבד המחקר

החוקרים התאימו משחק רב תכונות של קבלת החלטות שתוכנן במקור עבור משתתפים אנושיים. המשחק מציג רשת דיגיטלית המייצגת סלים של פרסים נסתרים, במטרה למקסם את התגמול הסופי על ידי בחירת הסל בעל ערך הנקודות הגבוה ביותר. כל תא חושף נקודות עלויות, מה שמאלץ את המשתתפים לאזן את עלות איסוף המידע מול היתרון של מציאת סל טוב יותר.

החוקרים המירו את המשחק החזותי הזה לפורמט מבוסס טקסט שמודלים של שפה יכולים לעבד. דגמי הבינה המלאכותית עברו מאות ניסויים בתנאי הנחיה שונים. חלקם קיבלו הוראות בסיסיות, חלקם קיבלו הנחיות המעודדות היגיון שלב אחר שלב, ואחרים הראו דוגמאות עבר של משחק אנושי. עבור כל סוג של דחיפה, החוקרים הפעילו כ-300 עד 340 ניסויים לכל דגם, וצרכו בערך שני מיליארד אסימוני טקסט בסך הכל.

נבדקו ארבעה סוגי דחיפות

המחקר בחן ארבעה סוגים ספציפיים של דחיפות שנועדו לחקות סביבות החלטות בעולם האמיתי:

  • דחיפות ברירת מחדל: סל אחד נבחר מראש, והסוכן נאלץ לקבל או לדחות אותו באופן פעיל.
  • דחיפות הצעות: הומלץ על סל אקראי מוקדם או מאוחר במשחק.
  • הדגשת מידע: הוזל יותר לחשוף ערכי פרסים מסוימים, מה שעלול לכוון את הסוכן לעבר בחירות לא אופטימליות.
  • דחיפות אופטימליות: נחשפו מראש תאים ספציפיים שימקסמו מבחינה מתמטית את הביצועים של שחקן אנושי.

שיעורי ציות מדאיגים

התוצאות חשפו הבדלים דרמטיים בין התנהגות קבלת החלטות של בני אדם ובינה מלאכותית.

כאשר הציגו בפניהם אפשרות ברירת מחדל, בני אדם בחרו ברירת המחדל בערך 88 אחוז מהמקרים. דגמי השפה היו תואמים יותר באופן משמעותי, כאשר מספר דגמים קיבלו את סל ברירת המחדל בין 99 ל-100 אחוז מהזמן.

דפוס זה נמשך עם דחיפות הצעה. בני אדם קיבלו סלים מוצעים באופן אקראי בתחילת המשחק 35 אחוז מהזמן. דגמי בינה מלאכותית רבים קיבלו את ההצעות האקראיות הללו בשיעורים גבוהים בהרבה, בעקבות עצות גם כשהן לא הציעו שום תועלת הגיונית.

תזמון ההצעות גם עשה מניפולציות על המודלים בדרכים לא טבעיות. בעוד שבני אדם עקבו אחר הצעות מאוחרות 25 אחוז מהזמן, חלק ממודלים של שפה הורידו את שיעורי הקבלה שלהם ל-7 עד 13 אחוזים. זה מרמז שהמודלים הגיבו בקפדנות לתזמון של הרמז במקום להעריך את התועלת האמיתית שלו.

אולי הכי מדאיג, כאשר חוקרים הדגישו בחירות לא אופטימליות באמצעות הדגשת מידע, בני אדם השתמשו במידע המטעה הזה 57 אחוז מהזמן. רוב דגמי הבינה המלאכותית שנבדקו עלו על קו הבסיס הזה במידה ניכרת, בעקבות הדגש הגרוע 83 עד 100 אחוז מהזמן.

בעיות נסתרות מאחורי ציונים טובים

החוקרים עקבו גם אחר האופן שבו המודלים אספו מידע לפני בחירה סופית. בני אדם נוטים לחשוף מספיק תאים כדי לנחש ניחוש מושכל. דגמי השפה רכשו מידע בדרכים מאוד חריגות ולא יעילות.

חלק מהדגמים בחרו בסל מבלי לחשוף תאים נסתרים, תוך התעלמות מוחלטת מההזדמנות לאסוף נתונים. מודלים אחרים הוציאו נקודות מופרזות בחשיפת שורות או עמודות שלמות, ובזבוז את התגמולים הפוטנציאליים שלהם. דגמים מסוימים הציגו הטיות מרחביות מוזרות, רק חשפו תאים בצד השמאלי הרחוק של הרשת או אך ורק לאורך קווים אלכסוניים.

אספקת מודלים עם הנחיה שלב אחר שלב או דוגמאות למשחק אנושי עשתה מעט מאוד כדי לתקן את הרגלי החיפוש המוזרים הללו.

המחברים ציינו כי הסתכלות רק על ציונים סופיים יכולה להסתיר את הבעיות הבסיסיות הללו. בחלק מהניסויים, דגמי הבינה המלאכותית זכו במספר דומה של נקודות נטו לשחקנים אנושיים. צופה מזדמן שבודק רק את הציון הסופי עשוי להניח שהדוגמניות עשו בחירות חכמות, דמויות אנוש. במציאות, המודלים השיגו לעתים קרובות את הציונים הללו באמצעות ציות עיוור במקום חשיבה אסטרטגית.

אם דחיפה במקרה הצביע על סל טוב, הבינה המלאכותית התואמת מדי קלע טוב. כשהדחיפה הצביעה לעבר סל גרוע, הבינה המלאכותית עקבה אחריו בעיוורון לתוצאה נמוכה יותר, והחמיצה לחלוטין את מטרת המשחק.

השלכות על פריסת סוכן בינה מלאכותית

"יישומים רבים של סוכני בינה מלאכותית מניחים בשתיקה שתחת אי ודאות, הם יגיבו בדרכים דמויות אנושיות, אם לא בצורה יותר רציונלית", אמר צ'רפ. "במקום לקבל את ההנחה הזו, החלטנו לחקור כיצד מתנהגים סוכנים כאשר הבחירות מוצגות בפניהם בדרכים שונות".

לממצאי המחקר יש השלכות משמעותיות על השוק הצומח במהירות של סוכני AI שנועדו לגלוש באינטרנט, להפעיל כלים ולקבל החלטות פיננסיות או קניות עבור המשתמשים. אם סוכנים אלה עוקבים באופן עיוור אחר אפשרויות ברירת המחדל, הצעות או מידע מודגש ללא הערכה קריטית, הם עלולים להיות מטופלים בקלות על ידי שחקנים גרועים או ממשקים מעוצבים בצורה גרועה.

המחקר מצביע על כך שלמודלים השפהיים הנוכחיים אין את הרציונליות המצומצמת שמנחה את קבלת ההחלטות האנושיות. בעוד שבני אדם משתמשים בקיצורי דרך מנטליים כדי לאזן בין עלות איסוף המידע לבין התגמול שבבחירה טובה, מודלים של AI אינם חולקים את האילוצים הביולוגיים הללו, אך הם מפגינים צורה משלהם של חוסר רציונליות שהיא ללא ספק קיצונית יותר ופחות צפויה.

הישאר לפני AI

לחדשות וניתוחים חדשים של AI, בקר ב-AI Buzz Wire.

קרא עוד חדשות AI →