در حالی که میلیون ها نفر برای پاسخ به اخبار، بحث های سیاسی و حتی نحوه رای دادن به چت ربات های هوش مصنوعی روی می آورند، یک مطالعه جدید یک سوال ناراحت کننده را مطرح می کند: وقتی مدل ها با ما موافق نیستند، به کدام سمت متمایل می شوند؟
پروژه ای که توسط استارتاپ تحلیلی Trakkr در ژوئن 2026 منتشر شد، دقیقاً نقشه آن را ترسیم کرد. محققان تمام مدلهای اصلی هوش مصنوعی را از طریق مجموعهای از پرسشهای پربار در مورد سیاست، اقتصاد، گفتار و جامعه مورد بررسی قرار دادند – و نتیجه اصلی این است که اکثر آنها به یک روش متمایل میشوند، البته نه به همان میزان و نه به همان اندازه که ناظران معمولی تصور میکنند. For more context on this story, see our ongoing AI trends.
مطالعه چگونه کار کرد
با توجه به روش Trakkr، هر مدل بارها از همان بانک سؤالات باز پرسیده شد، با جستجوی وب خاموش و هیچ درخواست سیستمی اعمال نشد. این جزئیات مهم است: با غیرفعال شدن بازیابی، خوانش ها منعکس کننده چیزی هستند که خود مدل به سمت آن گرایش دارد، مستقل از آنچه در حال حاضر آنلاین است.
سپس یک طبقهبندی خنثی جداگانه، هر پاسخ خام را میخواند، یک موضع امضا شده، درجه پوشش، نوع امتناع و هر زبان بارگذاری شده را ثبت میکند. نتایج به عنوان میانگین وزنی با فاصله اطمینان 95 درصد ترسیم شد و هر پاسخ خام به طور دائم ذخیره شد تا امتیازات مجدداً محاسبه شوند.
مهمتر از همه، هر مدل به عنوان یک ابر به جای یک نقطه نشان داده می شود. از آنجایی که هر مدل بارها اجرا شده است، تجسم گستردگی کاملی از جایی که در طول اجراها فرود آمده را به تصویر میکشد - تصویری صادقانهتر از یک برچسب واحد.
از دادههای جمعآوریشده تا 17 ژوئن 2026، این مطالعه شش مدل و بیش از 4400 پاسخ را پوشش داد.
یافته ها
این مدلها در دو محور ترسیم شدهاند: یک محور اقتصادی که از چپ به راست میرود و یک محور اجتماعی که از آزادیخواه به استبداد میرود.
چهار مدل از شش مدل به سمت چپ از مرکز متمایل شده اند. استثناهای برجسته در دو طرف طیف قرار دارند:- Grok نسبت به هر مدل آزمایش شده دورتر از سمت راست اندازه گیری شد، و به طور مشخص در زمانی که مستقیماً از آن پرسیده شد که به کدام سمت متمایل می شود، حدود 0.36 بیشتر از آنچه ادعا می کرد اندازه گیری شد.
- جمینی ثابت ترین مدل بود که نزدیک ترین نقطه به نقطه مرده در محور اقتصادی قرار داشت.
شکاف بین آنچه که یک مدل می گوید و آنچه که انجام می دهد یکی از آشکارترین معیارهای مطالعه است. کلود حدود 0.34 بیشتر از آنچه که خود گزارش کرده بود، اندازه گیری کرد. ChatGPT و Meta's Llama هر دو ادعای بیطرفی داشتند اما در سمت چپ به ترتیب تقریباً 0.29 و 0.17 اندازهگیری شدند. DeepSeek نزدیک مرکز فرود آمد و تا حد زیادی با توصیف خود مطابقت داشت.
یک نقشه، نه یک حکم
Trakkr مراقب است که کار را به عنوان توصیفی و نه تجویزی چارچوب بندی کند. این پروژه آنچه را که مدلها گفتهاند گزارش میکند بدون اینکه در مورد اینکه چه کسی درست میگوید، حکم میکند. پالت رنگ عمداً قرمز و آبی سیاست ایالات متحده نیست، و تجزیه و تحلیل هرگز نشان نمی دهد که کدام قطب ارجح است.
برای دادن معنای مختصات انتزاعی، محققان نقشه را با استفاده از چهرههای مرجع در دنیای واقعی - سران دولت، رهبران احزاب و جنبشهای سیاسی - که مواضع آنها از نظرسنجیهای تخصصی تثبیتشده، بهویژه بررسی تخصصی Chapel Hill 2024 (CHES) و مجموعه دادههای V-Dem ناشی میشود، به جای قضاوت خود تیم، تثبیت کردند.
این مطالعه همچنین سؤالات خاصی را که بیشتر مدلها را از هم جدا میکند، چهرههای دنیای واقعی که هر مدل به گرمی تمجید میکند یا از انتقاد کردن خودداری میکند، و یک لنز «جهانبینی» که همان مدلها را از منظر کشورها و زبانهای مختلف دوباره بررسی میکند، تجزیه میکند.
چرا مهم است
فشار شفافیت در بحبوحه تشدید بررسی نحوه شکل دهی سیستم های هوش مصنوعی به گفتمان عمومی صورت می گیرد. ناب بودن یک مدل، حتی یک مدل ظریف، می تواند بی سر و صدا مسیری را هدایت کند که یک خبر را خلاصه می کند، معاوضه سیاستی را ارزیابی می کند، یا شخصیت یک سیاستمدار را مشخص می کند. از آنجایی که پاسخهای رباتهای چت اغلب با اقتدار بیطرف به دست میآیند، کاربران به ندرت راهی برای تشخیص این انحراف دارند.
Trakkr با انتشار یک بانک سؤال باز با وزنهای امتیازدهی، برچسبگذاری هر مورد بهعنوان واقعی یا مبتنی بر ارزش، و انتشار دادههای زیربنایی تحت مجوز Creative Commons، از محققان خارجی دعوت میکند تا کار را تأیید و گسترش دهند - برخلاف ارزیابیهای اغلب مبهم منتشر شده توسط آزمایشگاههایی که خود مدلها را میسازند.
محدودیت ها
این مطالعه هشدارهای مهمی را تأیید می کند. موضع سیاسی چند بعدی است و فشرده کردن آن بر دو محور ناگزیر رنگ و بوی خود را از دست می دهد. پاسخها میتوانند با عبارت، زبان و منطقه تغییر کنند، به همین دلیل است که تیم پایداری اجرا به اجرا را اندازهگیری میکند و یک "آزمون مرزی" جداگانه اجرا میکند تا ببیند چگونه بازگرداندن جستجوی وب در نتایج مکان را تغییر میدهد.
هیچ کدام از اینها ثابت نمی کند که هیچ مدلی عمداً حزبی است. اما نشان میدهد که سیستمهای اصلی هوش مصنوعی زمین یکسانی را اشغال نمیکنند – و وقتی میلیونها نفر با آنها در مورد سؤالات مورد بحث مشورت میکنند، آن تفاوتهای کوچک اضافه میشوند.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →

