بر اساس مطالعه جدیدی که در مجموعه مقالات آکادمی ملی علوم منتشر شده است، مدل‌های زبان هوش مصنوعی به‌طور خطرناکی مستعد تغییرات ظریف در نحوه ارائه گزینه‌ها هستند و به تحریکات گمراه‌کننده بسیار قوی‌تر از انسان‌ها پاسخ می‌دهند.

این یافته‌ها نگرانی‌های جدی در مورد استقرار عوامل هوش مصنوعی برای تصمیم‌گیری مستقل در سناریوهای دنیای واقعی، از تراکنش‌های مالی گرفته تا انتخاب‌های مراقبت‌های بهداشتی، ایجاد می‌کند. همانطور که [AI Buzz Wire] (https://aibuzzwire.news) گزارش کرده است، شرکت‌ها به طور فزاینده‌ای عواملی را که دارای LLM هستند قرار می‌دهند تا از طرف کاربران در محیط‌های پیچیده عمل کنند.

این مطالعه که توسط Manuel Cherep، دانشجوی دکترا در آزمایشگاه رسانه موسسه فناوری ماساچوست انجام شد، 14 مدل زبان پیشرفته را از شرکت های بزرگ فناوری آزمایش کرد. مدل‌های آزمایش‌شده شامل نسخه‌های خانواده‌های GPT-3.5، GPT-4، و GPT-5 OpenAI، مدل‌های کلود 3 و 4.5 آنتروپیک و مدل‌های جمینی 1.5 و 2.5 گوگل بودند.

مطالعه چگونه کار کرد

محققان یک بازی تصمیم گیری چند ویژگی را اقتباس کردند که در اصل برای شرکت کنندگان انسانی طراحی شده بود. این بازی یک شبکه دیجیتالی ارائه می دهد که نشان دهنده سبدهای جوایز پنهان است، با هدف به حداکثر رساندن پاداش نهایی با انتخاب سبد با بالاترین ارزش امتیاز. هر سلول امتیاز هزینه‌ها را نشان می‌دهد و شرکت‌کنندگان را مجبور می‌کند هزینه جمع‌آوری اطلاعات را در مقابل سود یافتن یک سبد بهتر متعادل کنند.

محققان این بازی بصری را به قالبی مبتنی بر متن تبدیل کردند که مدل‌های زبان می‌توانند آن را پردازش کنند. مدل‌های هوش مصنوعی صدها آزمایش را تحت شرایط مختلف انجام دادند. برخی دستورالعمل‌های اساسی دریافت کردند، برخی از آنها پیام‌هایی دریافت کردند که منطق گام به گام را تشویق می‌کردند، و به برخی دیگر نمونه‌های قبلی از گیم‌پلی انسانی نشان داده شد. برای هر نوع نوج، محققان تقریباً 300 تا 340 آزمایش در هر مدل انجام دادند که در مجموع تقریباً دو میلیارد توکن متن مصرف کردند.

چهار نوع نوج تست شده است

این مطالعه چهار نوع خاص از تلنگر طراحی شده برای تقلید از محیط های تصمیم گیری در دنیای واقعی را بررسی کرد:

  • تارهای پیش فرض: یک سبد از قبل انتخاب شده بود و نماینده باید فعالانه آن را بپذیرد یا رد کند.
  • سوالات پیشنهادی: یک سبد تصادفی در اوایل یا اواخر بازی توصیه می شد.
  • برجستگی اطلاعات: برای فاش کردن مقادیر خاص جایزه ارزان تر شد و به طور بالقوه عامل را به سمت انتخاب های غیربهینه سوق داد.
  • تارهای بهینه: سلول های خاصی از قبل آشکار شده بودند که از نظر ریاضی عملکرد یک بازیکن انسانی را به حداکثر می رساند.

نرخ تطابق هشداردهنده

نتایج تفاوت های چشمگیری را بین رفتار تصمیم گیری انسان و هوش مصنوعی نشان داد.

هنگامی که یک گزینه پیش فرض ارائه می شود، انسان ها در حدود 88 درصد موارد پیش فرض را انتخاب می کنند. مدل های زبان به طور قابل توجهی سازگارتر بودند، به طوری که چندین مدل سبد پیش فرض را در 99 تا 100 درصد مواقع پذیرفتند.

این الگو با اشاره‌های پیشنهادی ادامه یافت. انسان ها در اوایل بازی در 35 درصد مواقع سبدهای پیشنهادی تصادفی را پذیرفتند. بسیاری از مدل‌های هوش مصنوعی این پیشنهادات تصادفی را با نرخ‌های بسیار بالاتری پذیرفتند، حتی زمانی که هیچ سود منطقی نداشتند.

زمان بندی پیشنهادات نیز مدل ها را به روش های غیر طبیعی دستکاری کرد. در حالی که انسان ها در 25 درصد موارد از پیشنهادات دیرهنگام پیروی می کردند، برخی از مدل های زبانی میزان پذیرش خود را به 7 تا 13 درصد کاهش دادند. این نشان می‌دهد که مدل‌ها به‌جای ارزیابی سودمندی واقعی آن، به زمان‌بندی نشانه واکنش جدی نشان می‌دهند.

شاید مهم‌تر از همه، زمانی که محققان انتخاب‌های غیربهینه را از طریق برجسته کردن اطلاعات برجسته کردند، انسان‌ها در 57 درصد مواقع از این اطلاعات گمراه‌کننده استفاده کردند. اکثر مدل‌های آزمایش‌شده هوش مصنوعی به‌طور قابل‌توجهی از این خط پایه فراتر رفته‌اند، که ۸۳ تا ۱۰۰ درصد موارد برجسته‌سازی بد را دنبال می‌کنند.

مشکلات پنهان پشت نمرات خوب

محققان همچنین نحوه جمع‌آوری اطلاعات توسط مدل‌ها را قبل از انتخاب نهایی پیگیری کردند. انسان‌ها تمایل دارند سلول‌های کافی برای حدس زدن درست را آشکار کنند. مدل های زبانی اطلاعات را از راه های بسیار غیرمعمول و ناکارآمد به دست آوردند.

برخی از مدل‌ها سبدها را بدون آشکار کردن سلول‌های مخفی انتخاب می‌کنند و به طور کامل فرصت جمع‌آوری داده‌ها را نادیده می‌گیرند. مدل‌های دیگر امتیازات زیادی را صرف نمایان کردن کل ردیف‌ها یا ستون‌ها می‌کنند و پاداش‌های بالقوه‌شان را هدر می‌دهند. برخی از مدل‌ها سوگیری‌های فضایی عجیب و غریبی را نشان می‌دادند، فقط سلول‌ها را در سمت چپ دور شبکه یا دقیقاً در امتداد خطوط مورب آشکار می‌کردند.

ارائه مدل‌هایی با درخواست‌های استدلال گام به گام یا نمونه‌هایی از گیم‌پلی انسانی کمک چندانی به رفع این عادات جستجوی عجیب و غریب کرد.

نویسندگان خاطرنشان کردند که فقط نگاه کردن به نمرات نهایی می تواند این مشکلات اساسی را پنهان کند. در برخی آزمایش‌ها، مدل‌های هوش مصنوعی به اندازه بازیکنان انسانی امتیاز خالص کسب کردند. یک ناظر معمولی که فقط امتیاز نهایی را بررسی می‌کند، ممکن است تصور کند که مدل‌ها انتخاب‌های هوشمندانه و شبیه انسان‌ها انجام می‌دهند. در واقعیت، مدل ها اغلب از طریق انطباق کورکورانه به جای تفکر استراتژیک به این امتیازات دست می یافتند.

اگر ضربه ای به سمت یک سبد خوب نشانه می رفت، هوش مصنوعی بیش از حد سازگار امتیاز خوبی کسب می کرد. وقتی ضربه به سمت یک سبد بد اشاره کرد، هوش مصنوعی کورکورانه آن را دنبال کرد و به امتیاز پایین‌تری رسید و هدف بازی را کاملا از دست داد.

پیامدها برای استقرار عامل هوش مصنوعی

چرپ گفت: «بسیاری از برنامه‌های کاربردی عوامل هوش مصنوعی به طور ضمنی فرض می‌کنند که در شرایط عدم قطعیت، آن‌ها به روش‌هایی تقریباً شبیه انسان واکنش نشان می‌دهند، اگر نه منطقی‌تر». ما تصمیم گرفتیم به جای پذیرش این فرض، بررسی کنیم که چگونه کارگزاران زمانی که انتخاب ها به روش های مختلف به آنها ارائه می شود، رفتار می کنند.

یافته های این مطالعه پیامدهای قابل توجهی برای بازار به سرعت در حال رشد عوامل هوش مصنوعی دارد که برای مرور وب، کارکرد ابزارها و تصمیم گیری مالی یا خرید برای کاربران طراحی شده اند. اگر این عوامل کورکورانه از گزینه‌های پیش‌فرض، پیشنهادها یا اطلاعات برجسته‌شده بدون ارزیابی انتقادی پیروی کنند، می‌توانند به راحتی توسط بازیگران بد یا رابط‌های طراحی ضعیف دستکاری شوند.

این تحقیق نشان می‌دهد که مدل‌های زبان فعلی فاقد عقلانیت محدود است که تصمیم‌گیری انسان را هدایت می‌کند. در حالی که انسان‌ها از میانبرهای ذهنی برای متعادل کردن هزینه جمع‌آوری اطلاعات در برابر پاداش انتخاب خوب استفاده می‌کنند، مدل‌های هوش مصنوعی این محدودیت‌های بیولوژیکی را به اشتراک نمی‌گذارند، با این حال آنها شکل خود را از غیرمنطقی نشان می‌دهند که مسلماً شدیدتر و کمتر قابل پیش‌بینی است.

از هوش مصنوعی جلوتر بمانید

برای اخبار و تحلیل‌های جدید هوش مصنوعی، به [AI Buzz Wire] (https://aibuzzwire.news) مراجعه کنید.

اخبار هوش مصنوعی را بیشتر بخوانید →