در حالی که میلیون ها نفر برای پاسخ به اخبار، بحث های سیاسی و حتی نحوه رای دادن به چت ربات های هوش مصنوعی روی می آورند، یک مطالعه جدید یک سوال ناراحت کننده را مطرح می کند: وقتی مدل ها با ما موافق نیستند، به کدام سمت متمایل می شوند؟

پروژه ای که توسط استارتاپ تحلیلی Trakkr در ژوئن 2026 منتشر شد، دقیقاً نقشه آن را ترسیم کرد. محققان تمام مدل‌های اصلی هوش مصنوعی را از طریق مجموعه‌ای از پرسش‌های پربار در مورد سیاست، اقتصاد، گفتار و جامعه مورد بررسی قرار دادند – و نتیجه اصلی این است که اکثر آنها به یک روش متمایل می‌شوند، البته نه به همان میزان و نه به همان اندازه که ناظران معمولی تصور می‌کنند. For more context on this story, see our ongoing AI trends.

مطالعه چگونه کار کرد

با توجه به روش Trakkr، هر مدل بارها از همان بانک سؤالات باز پرسیده شد، با جستجوی وب خاموش و هیچ درخواست سیستمی اعمال نشد. این جزئیات مهم است: با غیرفعال شدن بازیابی، خوانش ها منعکس کننده چیزی هستند که خود مدل به سمت آن گرایش دارد، مستقل از آنچه در حال حاضر آنلاین است.

سپس یک طبقه‌بندی خنثی جداگانه، هر پاسخ خام را می‌خواند، یک موضع امضا شده، درجه پوشش، نوع امتناع و هر زبان بارگذاری شده را ثبت می‌کند. نتایج به عنوان میانگین وزنی با فاصله اطمینان 95 درصد ترسیم شد و هر پاسخ خام به طور دائم ذخیره شد تا امتیازات مجدداً محاسبه شوند.

مهمتر از همه، هر مدل به عنوان یک ابر به جای یک نقطه نشان داده می شود. از آنجایی که هر مدل بارها اجرا شده است، تجسم گستردگی کاملی از جایی که در طول اجراها فرود آمده را به تصویر می‌کشد - تصویری صادقانه‌تر از یک برچسب واحد.

از داده‌های جمع‌آوری‌شده تا 17 ژوئن 2026، این مطالعه شش مدل و بیش از 4400 پاسخ را پوشش داد.

یافته ها

این مدل‌ها در دو محور ترسیم شده‌اند: یک محور اقتصادی که از چپ به راست می‌رود و یک محور اجتماعی که از آزادی‌خواه به استبداد می‌رود.

چهار مدل از شش مدل به سمت چپ از مرکز متمایل شده اند. استثناهای برجسته در دو طرف طیف قرار دارند:
  • Grok نسبت به هر مدل آزمایش شده دورتر از سمت راست اندازه گیری شد، و به طور مشخص در زمانی که مستقیماً از آن پرسیده شد که به کدام سمت متمایل می شود، حدود 0.36 بیشتر از آنچه ادعا می کرد اندازه گیری شد.
  • جمینی ثابت ترین مدل بود که نزدیک ترین نقطه به نقطه مرده در محور اقتصادی قرار داشت.

شکاف بین آنچه که یک مدل می گوید و آنچه که انجام می دهد یکی از آشکارترین معیارهای مطالعه است. کلود حدود 0.34 بیشتر از آنچه که خود گزارش کرده بود، اندازه گیری کرد. ChatGPT و Meta's Llama هر دو ادعای بی‌طرفی داشتند اما در سمت چپ به ترتیب تقریباً 0.29 و 0.17 اندازه‌گیری شدند. DeepSeek نزدیک مرکز فرود آمد و تا حد زیادی با توصیف خود مطابقت داشت.

یک نقشه، نه یک حکم

Trakkr مراقب است که کار را به عنوان توصیفی و نه تجویزی چارچوب بندی کند. این پروژه آنچه را که مدل‌ها گفته‌اند گزارش می‌کند بدون اینکه در مورد اینکه چه کسی درست می‌گوید، حکم می‌کند. پالت رنگ عمداً قرمز و آبی سیاست ایالات متحده نیست، و تجزیه و تحلیل هرگز نشان نمی دهد که کدام قطب ارجح است.

برای دادن معنای مختصات انتزاعی، محققان نقشه را با استفاده از چهره‌های مرجع در دنیای واقعی - سران دولت، رهبران احزاب و جنبش‌های سیاسی - که مواضع آنها از نظرسنجی‌های تخصصی تثبیت‌شده، به‌ویژه بررسی تخصصی Chapel Hill 2024 (CHES) و مجموعه داده‌های V-Dem ناشی می‌شود، به جای قضاوت خود تیم، تثبیت کردند.

این مطالعه همچنین سؤالات خاصی را که بیشتر مدل‌ها را از هم جدا می‌کند، چهره‌های دنیای واقعی که هر مدل به گرمی تمجید می‌کند یا از انتقاد کردن خودداری می‌کند، و یک لنز «جهان‌بینی» که همان مدل‌ها را از منظر کشورها و زبان‌های مختلف دوباره بررسی می‌کند، تجزیه می‌کند.

چرا مهم است

فشار شفافیت در بحبوحه تشدید بررسی نحوه شکل دهی سیستم های هوش مصنوعی به گفتمان عمومی صورت می گیرد. ناب بودن یک مدل، حتی یک مدل ظریف، می تواند بی سر و صدا مسیری را هدایت کند که یک خبر را خلاصه می کند، معاوضه سیاستی را ارزیابی می کند، یا شخصیت یک سیاستمدار را مشخص می کند. از آنجایی که پاسخ‌های ربات‌های چت اغلب با اقتدار بی‌طرف به دست می‌آیند، کاربران به ندرت راهی برای تشخیص این انحراف دارند.

Trakkr با انتشار یک بانک سؤال باز با وزن‌های امتیازدهی، برچسب‌گذاری هر مورد به‌عنوان واقعی یا مبتنی بر ارزش، و انتشار داده‌های زیربنایی تحت مجوز Creative Commons، از محققان خارجی دعوت می‌کند تا کار را تأیید و گسترش دهند - برخلاف ارزیابی‌های اغلب مبهم منتشر شده توسط آزمایشگاه‌هایی که خود مدل‌ها را می‌سازند.

محدودیت ها

این مطالعه هشدارهای مهمی را تأیید می کند. موضع سیاسی چند بعدی است و فشرده کردن آن بر دو محور ناگزیر رنگ و بوی خود را از دست می دهد. پاسخ‌ها می‌توانند با عبارت، زبان و منطقه تغییر کنند، به همین دلیل است که تیم پایداری اجرا به اجرا را اندازه‌گیری می‌کند و یک "آزمون مرزی" جداگانه اجرا می‌کند تا ببیند چگونه بازگرداندن جستجوی وب در نتایج مکان را تغییر می‌دهد.

هیچ کدام از اینها ثابت نمی کند که هیچ مدلی عمداً حزبی است. اما نشان می‌دهد که سیستم‌های اصلی هوش مصنوعی زمین یکسانی را اشغال نمی‌کنند – و وقتی میلیون‌ها نفر با آنها در مورد سؤالات مورد بحث مشورت می‌کنند، آن تفاوت‌های کوچک اضافه می‌شوند.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →