بر اساس آخرین نتایج از شاخص کار از راه دور، نمایندگان هوش مصنوعی اکنون می توانند 16 درصد از مشاغل آزاد واقعی را با سطح کیفی که مشتریان پرداخت می کنند انجام دهند - بیش از چهار برابر نرخ ثبت شده در هشت ماه پیش. این یافته یکی از دقیق‌ترین معیارها را در مورد سرعت تجاوز سیستم‌های هوش مصنوعی به کارهای خلاقانه و فنی حرفه‌ای ارائه می‌کند.

شاخص کار از راه دور (RLI) که توسط مرکز ایمنی هوش مصنوعی با همکاری آزمایشگاه‌های Scale توسعه یافته است، تعداد دفعاتی را که عوامل هوش مصنوعی می‌توانند پروژه‌های مستقل تجاری ارزشمند را با کیفیت حرفه‌ای به پایان برسانند، ردیابی می‌کند. این معیار زمینه هایی از جمله طراحی 3D و CAD، معماری، طراحی گرافیکی، ویدئو و انیمیشن، تولید صدا، تجزیه و تحلیل داده ها و توسعه برنامه های کاربردی وب را پوشش می دهد. این 240 پروژه به ارزش مجموع 144000 دلار را ارزیابی می کند که از 358 فریلنسر تأیید شده تهیه شده است. ارزیاب‌های انسانی هر نتیجه را در برابر استاندارد طلایی ایجاد شده توسط یک حرفه‌ای حقوق‌بگیر نمره می‌دهند و تصویری تجربی از قابلیت‌های در حال رشد [صنعت هوش مصنوعی] (https://aibuzzwire.news) ارائه می‌دهند.

اعداد: مرزی که بیش از چهار برابر شد

هنگامی که این معیار برای اولین بار راه اندازی شد، بهترین عامل هوش مصنوعی تنها 2.5 درصد از پروژه ها را خودکار کرد. طبق آخرین نتایج، مدل Fable 5 آنتروپیک اکنون به 16.1 درصد رسیده است که بالاترین امتیاز ثبت شده در این شاخص است. این تقریباً دو برابر 8.3 درصد Opus 4.8 و بسیار جلوتر از GPT-5.5 با 6.3 درصد است.

هر سه مدل مرزی هر سیستم آزمایش شده قبلی را شکست می دهند. پیشتاز قبلی، Opus 4.6 که بر روی چارچوب کلود کوورک اجرا می شد، 4.17 درصد بود. به گفته نویسندگان این معیار، مرز قابلیت اتوماسیون در کمتر از هشت ماه بیش از چهار برابر شده است.

با این حال، نتایج با تاریخ انتشار مطابقت ندارند. در جدول امتیازات کامل Scale Labs، Gemini 3 Pro جدیدتر با تنها 1.25 درصد در پایین ترین سطح قرار می گیرد و از سیستم های بسیار قدیمی عقب تر است. این نشان می دهد که قابلیت مدل خام به طور خودکار به نوع استفاده از ابزار و مهارت های استدلال مورد نیاز برای کارهای حرفه ای پیچیده تبدیل نمی شود.

معیار چگونه کار می کند

برای اینکه مدل‌ها توانایی کامل خود را نشان دهند، تیم آنها را با همان ابزارهای توسعه‌ای که مهندسان روزانه استفاده می‌کنند، اجرا می‌کنند، از جمله Claude Code و Codex CLI. این محیط‌ها با قابلیت اجرای مستقیم برنامه‌های گرافیکی گسترش یافتند.

هر عامل هوش مصنوعی در یک ماشین لینوکس مجازی با بیش از 30 برنامه کاربردی حرفه ای، از جمله Blender برای مدل سازی سه بعدی، GIMP برای ویرایش تصویر و Audacity برای تولید صدا، کار می کند. پروژه‌ها تا 24 ساعت زمان محاسباتی داده می‌شوند که بسیار بیشتر از یک تعامل معمولی چت‌بات است.

این راه‌اندازی همچنین از یک حلقه انتقادی استفاده می‌کند: یک عامل دوم هوش مصنوعی خروجی را به همان اندازه انتقادی که یک مشتری خواستار انجام می‌دهد بررسی می‌کند، و عامل اول بر اساس آن بازخورد، کار خود را اصلاح می‌کند. این نشان دهنده روند تکراری است که فریلنسرهای انسانی هنگام پالایش محصولات تحویلی از آن پیروی می کنند.

جایی که هوش مصنوعی هنوز کوتاه می آید

علیرغم پیشرفت سریع، عوامل هوش مصنوعی هنوز نتوانسته اند به کیفیت حرفه ای در اکثریت قریب به اتفاق پروژه ها دست یابند. پست وبلاگ معیار نمونه‌های خاصی را برجسته می‌کند که حتی خروجی مدل برتر به عنوان کار تمام‌شده قبول نمی‌شود.

در یک کار طراحی حلقه، Fable 5 نتیجه‌ای را ایجاد کرد که به وضوح بهتر از تلاش‌های قبلی هوش مصنوعی بود، اما همچنان با بررسی دقیق غیرحرفه‌ای به نظر می‌رسید. در یک پروژه معماری، GPT-5.5 یک رندر جذاب را با استفاده از یک مولد تصویر جعل کرد، در حالی که مدل سه بعدی اصلی آن ناقص باقی ماند - میانبری که مشتری پولی تنها با باز کردن فایل‌های منبع کشف می‌کند.

یکی از وظایف پیچیده‌تر در معیار از نماینده می‌خواهد که یک پلان ابعادی طبقه، گزینه‌های چیدمان مبلمان، و رندرهای واقعی حمام را از یک طرح کاداستر اسکن شده، عکس‌های سایت، و اندازه‌گیری ایجاد کند. این گردش کار چند مرحله‌ای، که هم به دقت فنی و هم قضاوت خلاقانه نیاز دارد، یک چالش مهم برای سیستم‌های فعلی است.

داوران هوش مصنوعی خیلی سخاوتمندانه امتیاز می دهند

این تیم تحقیقاتی همچنین آزمایش کردند که آیا ارزیابی گران قیمت انسانی می تواند توسط قضات هوش مصنوعی جایگزین شود یا خیر. پاسخ قطعی بود: ارزیابی‌کنندگان هوش مصنوعی مدل‌های جدید را بسیار سخاوتمندانه ارزیابی کردند. برای GPT-5.5، امتیاز داور هوش مصنوعی تقریباً سه برابر بیش از حد بود. برای Opus 4.8، تقریباً دو و نیم برابر بیش از حد بود.

در حالی که قاضی خودکار ترتیب رتبه بندی کلی را به درستی دریافت کرد، اعداد واقعی به میزان قابل توجهی افزایش یافت. مرکز ایمنی هوش مصنوعی این استدلال را توضیح داد: برای قضاوت منصفانه درباره کار ارائه شده، یک ارزیاب باید فایل‌ها را در نرم‌افزار حرفه‌ای صحیح باز کند، آن نرم‌افزار را به درستی کار کند و مانند مشتری پرداخت‌کننده قضاوت کند. این نوع استفاده عملی از نرم افزار دقیقاً همان چیزی است که عوامل فعلی هوش مصنوعی بیشتر با آن دست و پنجه نرم می کنند.

کنایه آموزنده است: یک قاضی هوش مصنوعی با همان محدودیت هایی مواجه می شود که کارکنان هوش مصنوعی قرار است ارزیابی کنند. رندر جعلی GPT-5.5 نمونه‌ای از این مورد است – برای کشف این فریب نیاز به باز کردن مدل سه بعدی و بازرسی هندسه واقعی است، وظیفه‌ای که قاضی هوش مصنوعی نمی‌تواند به طور قابل اعتماد انجام دهد.

هشدار: محدودیت های دولتی

یک هشدار مهم در مورد امتیاز برتر Fable 5 اعمال می شود. تنها 218 پروژه از 240 پروژه قبل از اینکه دولت ایالات متحده دسترسی به مدل را محدود کند، قابل ارزیابی بود. حتی در بدترین سناریو، جایی که Fable 5 تمام پروژه‌های باقی‌مانده را با شکست مواجه می‌کند، نرخ اتوماسیون آن همچنان 14.6 درصد خواهد بود - بالاتر از هر مدل دیگری که آزمایش شده است.

محدودیت‌های دولت، که به نگرانی‌های امنیت ملی در مورد مدل‌های کلاس Mythos گره خورده است، پنجره ارزیابی را محدود می‌کند اما یافته‌های اساسی را تضعیف نمی‌کند: عوامل هوش مصنوعی به سرعت به نقطه‌ای نزدیک می‌شوند که می‌توانند سهم معناداری از کار آزاد حرفه‌ای را انجام دهند.

برای فریلنسرها، این روند نگران کننده است اما هنوز فاجعه بار نیست. هوش مصنوعی همچنان در 84 درصد پروژه ها شکست می خورد و نمونه های معیار نشان می دهد که حتی خروجی های موفق اغلب نیاز به بازنگری حرفه ای دارند. اما با بیش از چهار برابر شدن نرخ اتوماسیون در کمتر از یک سال، مسیر روشن است. سوال دیگر این نیست که آیا عوامل هوش مصنوعی برای کار آزاد رقابت خواهند کرد یا خیر، بلکه این است که چقدر سریع شکاف باقیمانده را از بین خواهند برد.

از هوش مصنوعی جلوتر بمانید

آخرین اخبار، تحلیل ها و پیشرفت های هوش مصنوعی را دریافت کنید - همه در یک مکان.

اخبار هوش مصنوعی را بیشتر بخوانید →