بر اساس نتایج منتشر شده در روز چهارشنبه توسط بنیاد جایزه ARC، GPT-6 Astra از OpenAI نتایج پیشرفته‌ای را در ARC-AGI-3، معیار استدلال انتزاعی که برای اندازه‌گیری هوش عاملی طراحی شده است، منتشر کرده است. این مدل امتیاز 62.7٪ را در مجموعه نیمه خصوصی معیار تحت مهار استاندارد بنیاد و 99.9٪ را در هنگام ارزیابی با مهار آداپتور ارائه دهنده که حالت استدلال داخلی مدل را بین درخواست ها حفظ می کند، کسب کرد.

نتایج یک روز پس از آغاز راه‌اندازی مرحله‌ای Astra، مدلی که این شرکت به‌عنوان آغاز عصر جدید معرفی کرده است، به دست آمد. برای خوانندگانی که سعی می‌کنند امتیاز خود را به عنوان معیار تجارت آزمایشگاه‌های مرزی حفظ کنند، صفحه [آخرین پیشرفت‌های هوش مصنوعی] (https://aibuzzwire.news) هر نسخه اصلی را در زمان وقوع ردیابی می‌کند.

دو مهار، دو امتیاز بسیار متفاوت

فاصله بین دو شماره تیتر آسترا مهمترین جزئیات این گزارش است. جایزه ARC عوامل را تحت مهارهای مختلف ارزیابی می‌کند و هر کدام آنچه را که مدل مجاز به انجام آن با زمینه خاص خود است تغییر می‌دهد.

تحت مهار استاندارد، یک مدل می‌تواند یادداشت‌هایی را که انتخاب می‌کند در حین کار در یک محیط، نگه دارد. با این تنظیمات، Astra در حداکثر تلاش استدلالی 62.7٪ با هزینه کل 26098 دلار برای اجرای ارزیابی به دست آورد. در نقطه مقابل، اجرای همان مهار با استدلال خاموش تنها 35.2% تولید کرد در حالی که هزینه بیشتری داشت - 49791 دلار - زیرا این مدل برای پیشرفت به اقدامات بیشتری نیاز داشت.

مهار آداپتور ارائه‌دهنده سخاوتمندتر است: حالت استدلال مات مدل را بین درخواست‌ها حفظ می‌کند و از فشرده‌سازی برای مکالمات طولانی‌تر استفاده می‌کند و به Astra اجازه می‌دهد از کارهای قبلی مجددا استفاده کند. تحت این مهار، Astra در تلاش استدلال بالا برای 18817 دلار 99.9 درصد و در حداکثر تلاش برای 17332 دلار 98.6 درصد به دست آورد. حتی پایین ترین تنظیم استدلال به 96.7٪ رسید.

به عبارت دیگر، تفاوت بین یک امتیاز جزئی و یک نمره تقریباً کامل به تنهایی قابلیت خام نیست - بلکه این است که چقدر از حالت کار مدل بین مراحل باقی می ماند.

ضرب و شتم انسان ها در کارایی عمل

ARC-AGI-3 بر اساس محیط های بازی جدید، انتزاعی و نوبتی ساخته شده است. عوامل باید بدون دستورالعمل کاوش کنند، استنباط کنند که جهان چگونه کار می کند، اهداف را از پاداش های پراکنده شناسایی کنند، و اقدامات چند مرحله ای را برنامه ریزی کنند. محیط‌ها به گونه‌ای کالیبره شده‌اند که انسان‌ها می‌توانند 100 درصد آن‌ها را حل کنند، که باعث می‌شود عملکرد انسان به معیاری برای معیارها تبدیل شود.

Astra فقط اکثر سطوح را حل نکرد بلکه آنها را به طور موثر حل کرد. بر اساس جایزه ARC، این مدل از اقدامات کمتری نسبت به انسان آزمایش شده میانه در 96 درصد سطوح استفاده کرده است و از نظر کارایی عمل در کل مجموعه از خط پایه انسانی پیشی گرفته است.

مقوله اقتصادی مقایسه بسیار واضح است. شرکت کنندگان در آزمون انسانی 115 دلار در هر جلسه 90 دقیقه ای به اضافه 5 دلار به ازای هر بازی تکمیل شده پرداخت می کردند که تقریباً 12.78 دلار برای هر بازی تلاش می کرد. یک ارزیابی کامل Astra بسته به پیکربندی، پنج رقم هزینه دارد. اما جایزه ARC به یک چروک غیرمستقیم اشاره کرد: تلاش برای استدلال بیشتر معمولاً هزینه کمتری دارد، زیرا Astra بازی‌ها را در اقدامات کمتری حل می‌کند و تعداد کل تماس‌های مدل و توکن‌های سوزانده شده در هر اجرا را کاهش می‌دهد.

مدلی که زبان خودش را می سازد

فراتر از امتیازات، جایزه ARC رفتار کیفی را که تیم مشاهده کرده بود برجسته کرد. Astra دائماً محیط‌های ناآشنا را به مدل‌های جهان نمادین فشرده تبدیل می‌کند - مکانیک بازی را به عنوان قوانین منطقی نشان می‌دهد و مختصر مختص به دامنه خود را برای ردیابی وضعیت و اقدامات برنامه‌ریزی می‌کند.

این دقیقاً همان مهارتی است که ARC-AGI-3 برای کاوش طراحی شده است. در جایی که نسل‌های قبلی این معیار استدلال سیال را بر روی الگوهای جدید آزمایش می‌کردند، نسل سوم آزمایش می‌کرد که آیا یک عامل می‌تواند در محیط‌هایی که هرگز ندیده است کاوش، مدل‌سازی، تعیین اهداف و اجرای برنامه‌ها را انجام دهد - اجزای جایزه ARC به‌عنوان کاوش، مدل‌سازی، هدف‌گذاری، و برنامه‌ریزی و اجرا فهرست می‌شود.

پس زمینه AGI-Era

نتایج معیار در میان لفاظی های حداکثری از خود OpenAI به دست آمد. در یک نشست مطبوعاتی قبل از عرضه در روز پنج‌شنبه، گرگ براکمن، رئیس شرکت، گفت که «غیرمنطقی نیست که احساس کنیم اکنون در عصر AGI هستیم»، در حالی که بر اساس پوشش The New Stack از راه‌اندازی، از اعلامیه رسمی خودداری می‌کنیم. او AGI را به عنوان یک "مفهوم ماموریت یا مفهوم معنوی" به جای یک محرک قراردادی توصیف کرد.

آیدان کلارک، محقق OpenAI، گفت که Astra بزرگترین دوره آموزشی شرکت تا به امروز بوده است - اولین نسخه از قبل آموزش‌دیده شده روی بیش از 100000 پردازنده گرافیکی در سایت Stargate در تگزاس - و اولین نسخه OpenAI که در آن مدل‌های قبلی نقش مهمی در نظارت بر روند آموزش داشتند. دسترسی همچنان مرحله‌ای است: عرضه با مشتریان سازمانی در برنامه Daybreak آغاز می‌شود، با در دسترس بودن Plus، Pro، Business و Enterprise به علاوه دسترسی API و AWS در روزهای آینده وعده داده شده است.

ستاره روی امتیاز

احتیاط در چندین جبهه ضروری است. عملکرد ARC-AGI-3 Astra به شدت به پیکربندی مهار بستگی دارد، همانطور که دو عدد سرفصل نشان می‌دهند، و مهارهای سفارشی که حالت مدل را حفظ می‌کنند، یک نقطه اختلاف مکرر در مناقشات معیار بوده‌اند. تجزیه و تحلیل New Stack از راه اندازی اشاره کرد که Astra "در کارهای تخصصی دستاوردهای بزرگی را به همراه دارد، اما امتیاز بالایی دارد و به وضوح پیشروی بسته کدنویسی نیست" - یادآور این است که معیارهای معماهای نمایندگی و بار کاری تجاری روزمره چیزهای مختلفی را اندازه گیری می کنند.

خود جایزه ARC این تمرین را به عنوان اندازه‌گیری «شکاف باقی‌مانده» بین هوش مصنوعی و AGI فعلی تعریف می‌کند و AGI را به عنوان توانایی به دست آوردن هر مهارتی که یک انسان می‌تواند به همان میزان کارآمدی یک انسان تعریف می‌کند. یک امتیاز تقریباً عالی در شرایط مساعد به خودی خود این شکاف را برطرف نمی کند. و با 17000 تا 50000 دلار در هر مرحله ارزیابی، فقط آزمایشگاه‌های دارای منابع خوب می‌توانند معیار را در این مقیاس اجرا کنند - اگرچه داده‌های هزینه ARC Prize نشان می‌دهد که استدلال هوشمندانه‌تر در واقع می‌تواند صورت حساب را کاهش دهد.

چرا مهم است

کارایی عمل یک محور جدید مقایسه است. مدلی که هر سطحی را حل می‌کند اما هزاران تماس را در انجام آن تلف می‌کند، کمتر مفید - و گران‌تر - از مدلی است که مانند Astra در اینجا عمل می‌کند: کاوش عمدی، فشرده‌سازی آنچه می‌آموزد، و عمل کردن بر اساس آن. هر چه کسی در مورد بحث AGI نتیجه بگیرد، داده های جایزه ARC نشان می دهد که عوامل مرزی اکنون با انسان ها مطابقت دارند نه فقط در مورد اینکه آیا می توانند مشکلات جدید را حل کنند، بلکه در مورد اینکه چگونه آنها را از نظر اقتصادی حل می کنند.

از هوش مصنوعی جلوتر بمانید

هر نتیجه معیار، راه‌اندازی مدل و بحث ایمنی، همانطور که اتفاق می‌افتد ردیابی می‌شود - [اخبار هوش مصنوعی را بیشتر بخوانید →] (https://aibuzzwire.news)