بر اساس آخرین نتایج از شاخص کار از راه دور، نمایندگان هوش مصنوعی اکنون می توانند 16 درصد از مشاغل آزاد واقعی را با سطح کیفی که مشتریان پرداخت می کنند انجام دهند - بیش از چهار برابر نرخ ثبت شده در هشت ماه پیش. این یافته یکی از دقیقترین معیارها را در مورد سرعت تجاوز سیستمهای هوش مصنوعی به کارهای خلاقانه و فنی حرفهای ارائه میکند.
شاخص کار از راه دور (RLI) که توسط مرکز ایمنی هوش مصنوعی با همکاری آزمایشگاههای Scale توسعه یافته است، تعداد دفعاتی را که عوامل هوش مصنوعی میتوانند پروژههای مستقل تجاری ارزشمند را با کیفیت حرفهای به پایان برسانند، ردیابی میکند. این معیار زمینه هایی از جمله طراحی 3D و CAD، معماری، طراحی گرافیکی، ویدئو و انیمیشن، تولید صدا، تجزیه و تحلیل داده ها و توسعه برنامه های کاربردی وب را پوشش می دهد. این 240 پروژه به ارزش مجموع 144000 دلار را ارزیابی می کند که از 358 فریلنسر تأیید شده تهیه شده است. ارزیابهای انسانی هر نتیجه را در برابر استاندارد طلایی ایجاد شده توسط یک حرفهای حقوقبگیر نمره میدهند و تصویری تجربی از قابلیتهای در حال رشد [صنعت هوش مصنوعی] (https://aibuzzwire.news) ارائه میدهند.
اعداد: مرزی که بیش از چهار برابر شد
هنگامی که این معیار برای اولین بار راه اندازی شد، بهترین عامل هوش مصنوعی تنها 2.5 درصد از پروژه ها را خودکار کرد. طبق آخرین نتایج، مدل Fable 5 آنتروپیک اکنون به 16.1 درصد رسیده است که بالاترین امتیاز ثبت شده در این شاخص است. این تقریباً دو برابر 8.3 درصد Opus 4.8 و بسیار جلوتر از GPT-5.5 با 6.3 درصد است.
هر سه مدل مرزی هر سیستم آزمایش شده قبلی را شکست می دهند. پیشتاز قبلی، Opus 4.6 که بر روی چارچوب کلود کوورک اجرا می شد، 4.17 درصد بود. به گفته نویسندگان این معیار، مرز قابلیت اتوماسیون در کمتر از هشت ماه بیش از چهار برابر شده است.
با این حال، نتایج با تاریخ انتشار مطابقت ندارند. در جدول امتیازات کامل Scale Labs، Gemini 3 Pro جدیدتر با تنها 1.25 درصد در پایین ترین سطح قرار می گیرد و از سیستم های بسیار قدیمی عقب تر است. این نشان می دهد که قابلیت مدل خام به طور خودکار به نوع استفاده از ابزار و مهارت های استدلال مورد نیاز برای کارهای حرفه ای پیچیده تبدیل نمی شود.
معیار چگونه کار می کند
برای اینکه مدلها توانایی کامل خود را نشان دهند، تیم آنها را با همان ابزارهای توسعهای که مهندسان روزانه استفاده میکنند، اجرا میکنند، از جمله Claude Code و Codex CLI. این محیطها با قابلیت اجرای مستقیم برنامههای گرافیکی گسترش یافتند.
هر عامل هوش مصنوعی در یک ماشین لینوکس مجازی با بیش از 30 برنامه کاربردی حرفه ای، از جمله Blender برای مدل سازی سه بعدی، GIMP برای ویرایش تصویر و Audacity برای تولید صدا، کار می کند. پروژهها تا 24 ساعت زمان محاسباتی داده میشوند که بسیار بیشتر از یک تعامل معمولی چتبات است.
این راهاندازی همچنین از یک حلقه انتقادی استفاده میکند: یک عامل دوم هوش مصنوعی خروجی را به همان اندازه انتقادی که یک مشتری خواستار انجام میدهد بررسی میکند، و عامل اول بر اساس آن بازخورد، کار خود را اصلاح میکند. این نشان دهنده روند تکراری است که فریلنسرهای انسانی هنگام پالایش محصولات تحویلی از آن پیروی می کنند.
جایی که هوش مصنوعی هنوز کوتاه می آید
علیرغم پیشرفت سریع، عوامل هوش مصنوعی هنوز نتوانسته اند به کیفیت حرفه ای در اکثریت قریب به اتفاق پروژه ها دست یابند. پست وبلاگ معیار نمونههای خاصی را برجسته میکند که حتی خروجی مدل برتر به عنوان کار تمامشده قبول نمیشود.
در یک کار طراحی حلقه، Fable 5 نتیجهای را ایجاد کرد که به وضوح بهتر از تلاشهای قبلی هوش مصنوعی بود، اما همچنان با بررسی دقیق غیرحرفهای به نظر میرسید. در یک پروژه معماری، GPT-5.5 یک رندر جذاب را با استفاده از یک مولد تصویر جعل کرد، در حالی که مدل سه بعدی اصلی آن ناقص باقی ماند - میانبری که مشتری پولی تنها با باز کردن فایلهای منبع کشف میکند.
یکی از وظایف پیچیدهتر در معیار از نماینده میخواهد که یک پلان ابعادی طبقه، گزینههای چیدمان مبلمان، و رندرهای واقعی حمام را از یک طرح کاداستر اسکن شده، عکسهای سایت، و اندازهگیری ایجاد کند. این گردش کار چند مرحلهای، که هم به دقت فنی و هم قضاوت خلاقانه نیاز دارد، یک چالش مهم برای سیستمهای فعلی است.
داوران هوش مصنوعی خیلی سخاوتمندانه امتیاز می دهند
این تیم تحقیقاتی همچنین آزمایش کردند که آیا ارزیابی گران قیمت انسانی می تواند توسط قضات هوش مصنوعی جایگزین شود یا خیر. پاسخ قطعی بود: ارزیابیکنندگان هوش مصنوعی مدلهای جدید را بسیار سخاوتمندانه ارزیابی کردند. برای GPT-5.5، امتیاز داور هوش مصنوعی تقریباً سه برابر بیش از حد بود. برای Opus 4.8، تقریباً دو و نیم برابر بیش از حد بود.
در حالی که قاضی خودکار ترتیب رتبه بندی کلی را به درستی دریافت کرد، اعداد واقعی به میزان قابل توجهی افزایش یافت. مرکز ایمنی هوش مصنوعی این استدلال را توضیح داد: برای قضاوت منصفانه درباره کار ارائه شده، یک ارزیاب باید فایلها را در نرمافزار حرفهای صحیح باز کند، آن نرمافزار را به درستی کار کند و مانند مشتری پرداختکننده قضاوت کند. این نوع استفاده عملی از نرم افزار دقیقاً همان چیزی است که عوامل فعلی هوش مصنوعی بیشتر با آن دست و پنجه نرم می کنند.
کنایه آموزنده است: یک قاضی هوش مصنوعی با همان محدودیت هایی مواجه می شود که کارکنان هوش مصنوعی قرار است ارزیابی کنند. رندر جعلی GPT-5.5 نمونهای از این مورد است – برای کشف این فریب نیاز به باز کردن مدل سه بعدی و بازرسی هندسه واقعی است، وظیفهای که قاضی هوش مصنوعی نمیتواند به طور قابل اعتماد انجام دهد.
هشدار: محدودیت های دولتی
یک هشدار مهم در مورد امتیاز برتر Fable 5 اعمال می شود. تنها 218 پروژه از 240 پروژه قبل از اینکه دولت ایالات متحده دسترسی به مدل را محدود کند، قابل ارزیابی بود. حتی در بدترین سناریو، جایی که Fable 5 تمام پروژههای باقیمانده را با شکست مواجه میکند، نرخ اتوماسیون آن همچنان 14.6 درصد خواهد بود - بالاتر از هر مدل دیگری که آزمایش شده است.
محدودیتهای دولت، که به نگرانیهای امنیت ملی در مورد مدلهای کلاس Mythos گره خورده است، پنجره ارزیابی را محدود میکند اما یافتههای اساسی را تضعیف نمیکند: عوامل هوش مصنوعی به سرعت به نقطهای نزدیک میشوند که میتوانند سهم معناداری از کار آزاد حرفهای را انجام دهند.
برای فریلنسرها، این روند نگران کننده است اما هنوز فاجعه بار نیست. هوش مصنوعی همچنان در 84 درصد پروژه ها شکست می خورد و نمونه های معیار نشان می دهد که حتی خروجی های موفق اغلب نیاز به بازنگری حرفه ای دارند. اما با بیش از چهار برابر شدن نرخ اتوماسیون در کمتر از یک سال، مسیر روشن است. سوال دیگر این نیست که آیا عوامل هوش مصنوعی برای کار آزاد رقابت خواهند کرد یا خیر، بلکه این است که چقدر سریع شکاف باقیمانده را از بین خواهند برد.
از هوش مصنوعی جلوتر بمانید
آخرین اخبار، تحلیل ها و پیشرفت های هوش مصنوعی را دریافت کنید - همه در یک مکان.
اخبار هوش مصنوعی را بیشتر بخوانید →


