بر اساس نتایج منتشر شده در روز چهارشنبه توسط بنیاد جایزه ARC، GPT-6 Astra از OpenAI نتایج پیشرفتهای را در ARC-AGI-3، معیار استدلال انتزاعی که برای اندازهگیری هوش عاملی طراحی شده است، منتشر کرده است. این مدل امتیاز 62.7٪ را در مجموعه نیمه خصوصی معیار تحت مهار استاندارد بنیاد و 99.9٪ را در هنگام ارزیابی با مهار آداپتور ارائه دهنده که حالت استدلال داخلی مدل را بین درخواست ها حفظ می کند، کسب کرد.
نتایج یک روز پس از آغاز راهاندازی مرحلهای Astra، مدلی که این شرکت بهعنوان آغاز عصر جدید معرفی کرده است، به دست آمد. برای خوانندگانی که سعی میکنند امتیاز خود را به عنوان معیار تجارت آزمایشگاههای مرزی حفظ کنند، صفحه [آخرین پیشرفتهای هوش مصنوعی] (https://aibuzzwire.news) هر نسخه اصلی را در زمان وقوع ردیابی میکند.
دو مهار، دو امتیاز بسیار متفاوت
فاصله بین دو شماره تیتر آسترا مهمترین جزئیات این گزارش است. جایزه ARC عوامل را تحت مهارهای مختلف ارزیابی میکند و هر کدام آنچه را که مدل مجاز به انجام آن با زمینه خاص خود است تغییر میدهد.
تحت مهار استاندارد، یک مدل میتواند یادداشتهایی را که انتخاب میکند در حین کار در یک محیط، نگه دارد. با این تنظیمات، Astra در حداکثر تلاش استدلالی 62.7٪ با هزینه کل 26098 دلار برای اجرای ارزیابی به دست آورد. در نقطه مقابل، اجرای همان مهار با استدلال خاموش تنها 35.2% تولید کرد در حالی که هزینه بیشتری داشت - 49791 دلار - زیرا این مدل برای پیشرفت به اقدامات بیشتری نیاز داشت.
مهار آداپتور ارائهدهنده سخاوتمندتر است: حالت استدلال مات مدل را بین درخواستها حفظ میکند و از فشردهسازی برای مکالمات طولانیتر استفاده میکند و به Astra اجازه میدهد از کارهای قبلی مجددا استفاده کند. تحت این مهار، Astra در تلاش استدلال بالا برای 18817 دلار 99.9 درصد و در حداکثر تلاش برای 17332 دلار 98.6 درصد به دست آورد. حتی پایین ترین تنظیم استدلال به 96.7٪ رسید.
به عبارت دیگر، تفاوت بین یک امتیاز جزئی و یک نمره تقریباً کامل به تنهایی قابلیت خام نیست - بلکه این است که چقدر از حالت کار مدل بین مراحل باقی می ماند.
ضرب و شتم انسان ها در کارایی عمل
ARC-AGI-3 بر اساس محیط های بازی جدید، انتزاعی و نوبتی ساخته شده است. عوامل باید بدون دستورالعمل کاوش کنند، استنباط کنند که جهان چگونه کار می کند، اهداف را از پاداش های پراکنده شناسایی کنند، و اقدامات چند مرحله ای را برنامه ریزی کنند. محیطها به گونهای کالیبره شدهاند که انسانها میتوانند 100 درصد آنها را حل کنند، که باعث میشود عملکرد انسان به معیاری برای معیارها تبدیل شود.
Astra فقط اکثر سطوح را حل نکرد بلکه آنها را به طور موثر حل کرد. بر اساس جایزه ARC، این مدل از اقدامات کمتری نسبت به انسان آزمایش شده میانه در 96 درصد سطوح استفاده کرده است و از نظر کارایی عمل در کل مجموعه از خط پایه انسانی پیشی گرفته است.
مقوله اقتصادی مقایسه بسیار واضح است. شرکت کنندگان در آزمون انسانی 115 دلار در هر جلسه 90 دقیقه ای به اضافه 5 دلار به ازای هر بازی تکمیل شده پرداخت می کردند که تقریباً 12.78 دلار برای هر بازی تلاش می کرد. یک ارزیابی کامل Astra بسته به پیکربندی، پنج رقم هزینه دارد. اما جایزه ARC به یک چروک غیرمستقیم اشاره کرد: تلاش برای استدلال بیشتر معمولاً هزینه کمتری دارد، زیرا Astra بازیها را در اقدامات کمتری حل میکند و تعداد کل تماسهای مدل و توکنهای سوزانده شده در هر اجرا را کاهش میدهد.
مدلی که زبان خودش را می سازد
فراتر از امتیازات، جایزه ARC رفتار کیفی را که تیم مشاهده کرده بود برجسته کرد. Astra دائماً محیطهای ناآشنا را به مدلهای جهان نمادین فشرده تبدیل میکند - مکانیک بازی را به عنوان قوانین منطقی نشان میدهد و مختصر مختص به دامنه خود را برای ردیابی وضعیت و اقدامات برنامهریزی میکند.
این دقیقاً همان مهارتی است که ARC-AGI-3 برای کاوش طراحی شده است. در جایی که نسلهای قبلی این معیار استدلال سیال را بر روی الگوهای جدید آزمایش میکردند، نسل سوم آزمایش میکرد که آیا یک عامل میتواند در محیطهایی که هرگز ندیده است کاوش، مدلسازی، تعیین اهداف و اجرای برنامهها را انجام دهد - اجزای جایزه ARC بهعنوان کاوش، مدلسازی، هدفگذاری، و برنامهریزی و اجرا فهرست میشود.
پس زمینه AGI-Era
نتایج معیار در میان لفاظی های حداکثری از خود OpenAI به دست آمد. در یک نشست مطبوعاتی قبل از عرضه در روز پنجشنبه، گرگ براکمن، رئیس شرکت، گفت که «غیرمنطقی نیست که احساس کنیم اکنون در عصر AGI هستیم»، در حالی که بر اساس پوشش The New Stack از راهاندازی، از اعلامیه رسمی خودداری میکنیم. او AGI را به عنوان یک "مفهوم ماموریت یا مفهوم معنوی" به جای یک محرک قراردادی توصیف کرد.
آیدان کلارک، محقق OpenAI، گفت که Astra بزرگترین دوره آموزشی شرکت تا به امروز بوده است - اولین نسخه از قبل آموزشدیده شده روی بیش از 100000 پردازنده گرافیکی در سایت Stargate در تگزاس - و اولین نسخه OpenAI که در آن مدلهای قبلی نقش مهمی در نظارت بر روند آموزش داشتند. دسترسی همچنان مرحلهای است: عرضه با مشتریان سازمانی در برنامه Daybreak آغاز میشود، با در دسترس بودن Plus، Pro، Business و Enterprise به علاوه دسترسی API و AWS در روزهای آینده وعده داده شده است.
ستاره روی امتیاز
احتیاط در چندین جبهه ضروری است. عملکرد ARC-AGI-3 Astra به شدت به پیکربندی مهار بستگی دارد، همانطور که دو عدد سرفصل نشان میدهند، و مهارهای سفارشی که حالت مدل را حفظ میکنند، یک نقطه اختلاف مکرر در مناقشات معیار بودهاند. تجزیه و تحلیل New Stack از راه اندازی اشاره کرد که Astra "در کارهای تخصصی دستاوردهای بزرگی را به همراه دارد، اما امتیاز بالایی دارد و به وضوح پیشروی بسته کدنویسی نیست" - یادآور این است که معیارهای معماهای نمایندگی و بار کاری تجاری روزمره چیزهای مختلفی را اندازه گیری می کنند.
خود جایزه ARC این تمرین را به عنوان اندازهگیری «شکاف باقیمانده» بین هوش مصنوعی و AGI فعلی تعریف میکند و AGI را به عنوان توانایی به دست آوردن هر مهارتی که یک انسان میتواند به همان میزان کارآمدی یک انسان تعریف میکند. یک امتیاز تقریباً عالی در شرایط مساعد به خودی خود این شکاف را برطرف نمی کند. و با 17000 تا 50000 دلار در هر مرحله ارزیابی، فقط آزمایشگاههای دارای منابع خوب میتوانند معیار را در این مقیاس اجرا کنند - اگرچه دادههای هزینه ARC Prize نشان میدهد که استدلال هوشمندانهتر در واقع میتواند صورت حساب را کاهش دهد.
چرا مهم است
کارایی عمل یک محور جدید مقایسه است. مدلی که هر سطحی را حل میکند اما هزاران تماس را در انجام آن تلف میکند، کمتر مفید - و گرانتر - از مدلی است که مانند Astra در اینجا عمل میکند: کاوش عمدی، فشردهسازی آنچه میآموزد، و عمل کردن بر اساس آن. هر چه کسی در مورد بحث AGI نتیجه بگیرد، داده های جایزه ARC نشان می دهد که عوامل مرزی اکنون با انسان ها مطابقت دارند نه فقط در مورد اینکه آیا می توانند مشکلات جدید را حل کنند، بلکه در مورد اینکه چگونه آنها را از نظر اقتصادی حل می کنند.
از هوش مصنوعی جلوتر بمانید
هر نتیجه معیار، راهاندازی مدل و بحث ایمنی، همانطور که اتفاق میافتد ردیابی میشود - [اخبار هوش مصنوعی را بیشتر بخوانید →] (https://aibuzzwire.news)
