یک معیار جدید نحوه سنجش توانایی های علمی صنعت هوش مصنوعی را به چالش می کشد و اولین نتایج آن برای آزمایشگاه های مرزی فروتن است. Terminal-Bench-Science 0.1 که این هفته توسط محققان دانشگاه استنفورد و تیم پشتیبان معیار کدنویسی محبوب Terminal-Bench راه‌اندازی شد، عوامل هوش مصنوعی را بر روی گردش‌های کاری تحقیقاتی علمی واقعی که توسط دانشمندان شاغل ارائه شده است، ارزیابی می‌کند - و قوی‌ترین مدل آزمایش‌شده، Claude Opus 5 است که از طریق Claude Code انجام می‌شود، و تنها 30 کار را انجام می‌دهد.

صفحه اعلام معیار، اصل راهنمای آن را به صراحت شرح می دهد: دانشمندان، نه توسعه دهندگان مدل یا فروشندگان داده، باید نوار توانایی علمی در هوش مصنوعی را تعیین کنند. این پروژه با همکاری کارشناسان حوزه از موسسات تحقیقاتی در سراسر جهان ساخته شده است و اولین نسخه آن شامل 70 وظیفه است که شامل علوم زیستی، فیزیک، علوم زمین، ریاضیات و مهندسی می شود.

تفاوت آن با معیارهای کتاب درسی

بیشتر ارزیابی‌های علمی هوش مصنوعی دانش را آزمایش می‌کنند: سؤالات چند گزینه‌ای، مسائل کتاب درسی، تمرین‌های استاندارد. Terminal-Bench-Science در عوض اندازه‌گیری می‌کند که آیا عوامل می‌توانند جریان‌های کاری سخت‌گیرانه و زمان‌بر را که روزهای واقعی محققین را پر می‌کند، اجرا کنند - کاری که در هیچ امتحانی ظاهر نمی‌شود. وظایف در محیط‌های واقع‌گرایانه اجرا می‌شوند و درجه‌بندی بر اساس مصنوعات عینی است: تحلیل‌ها، شبیه‌سازی‌ها، اثبات‌ها، کدها و محصولات داده‌ای که به جای قضاوت در مدل‌ها یا امتیازدهی چندگزینه‌ای، با آزمون‌های تکلیفی قابل تکرار بررسی می‌شوند.

این طراحی منعکس کننده یک نظریه است که دستیاران هوش مصنوعی در نهایت باید برای علم انجام دهند. به‌جای جایگزینی قضاوت علمی، نویسندگان معیار استدلال می‌کنند، عوامل باید لایه اجرا را در دست بگیرند - اجرای آزمایش‌ها در سیلیکو، پردازش داده‌ها، بررسی شواهد - تا دانشمندان را برای بخش‌هایی از تحقیق که قضاوت انسانی در آن‌ها اهمیت بیشتری دارد: تعریف سؤالات، شکل‌دهی فرضیه‌ها، یافتن نتایج و تفسیر نتایج، آزاد کنند.

این پروژه همچنین به صراحت به عنوان یک هدف متحرک ساخته شده است. در جایی که بسیاری از معیارها یک بار منتشر می شوند و رها می شوند - در اطلاعیه این مشکل "مقالاتی برای انتشار" نامیده می شود - Terminal-Bench-Science به عنوان معیاری پیوسته طراحی شده است که در کنار مرز تکامل می یابد، با انتشارات منظم که هدف آن حفظ ارزیابی پیش از پیشرفت مدل و جلوگیری از تورم امتیاز ناشی از آلودگی است.

اولین تابلوی برتر: راه طولانی تا قابل اعتماد بودن

تابلوی امتیازات نسخه 1، که با رسیدن به اخبار هکر این هفته توجه قابل توجهی را به خود جلب کرد، افت شدیدی را از بالا نشان می دهد:

  • Claude Opus 5 (Claude Code): 30.0%
  • GPT-5.6 Sol (Codex): 22.4٪
  • Claude Fable 5 (Claude Code): 21.4%
  • Claude Opus 4.8 (Claude Code): 10.5%
  • GPT-5.6 Terra (Codex): 8.6٪
  • GLM 5.3 (Claude Code): 8.1%
  • Kimi K3 (Claude Code): 7.1%
  • Grok 4.6 (Grok Build): 7.1%
  • GPT-5.6 Luna (Codex): 3.3٪

نتایج نشان می‌دهد که جریان‌های کاری علمی برای عامل‌ها به‌طور قابل‌توجهی سخت‌تر از مهندسی نرم‌افزار باقی می‌ماند، جایی که معیارهای اصلی Terminal-Bench و کدنویسی رقیب شاهد افزایش سریع امتیازات بوده‌اند. نرخ تفکیک 30% برای بهترین سیستم موجود به این معنی است که در هفت مورد از 10 کار تحقیقاتی واقعی، حتی یک عامل رده بالا که با یک مهار قوی جفت شده است، نمی تواند کار صحیح قابل تاییدی تولید کند.

گسترش در خانواده های الگو نیز آموزنده است. فاصله بین Claude Opus 5 و Claude Opus 4.8 - تقریباً بیست امتیاز - و بین انواع GPT-5.6 Sol، Terra و Luna نشان می دهد که کیفیت نتیجه تا چه حد به تعامل مدل و مهار عامل بستگی دارد، نه به هوش مدل خام. هر ورودی با امتیاز بالا از یک مهار کدگذاری عاملی (Claude Code، Codex، Grok Build) استفاده می کند، که این اجماع در حال ظهور را تقویت می کند که داربست به اندازه وزن های اساسی تعیین کننده است.

چرا دانشمندان معیار خود را ساختند

چارچوب بندی معیار دارای یک استدلال نهادی ظریف است. در این اطلاعیه آمده است: "مخاطرات علم بسیار زیاد است و معیارهای آن باید اولویت های جامعه علمی را به جای منافع بیرونی منعکس کند." این پروژه به محققین شاغل مکانیزمی مستقیم می دهد تا وظایفی را که واقعاً به آنها نیاز دارند به صورت خودکار رمزگذاری کنند - و ادعاهای فروشندگان مبنی بر "شتاب بخشیدن به کشف علمی" را در مقابل یک استاندارد قابل تایید نگه دارند.

این مهم است زیرا شکاف بین بازاریابی و واقعیت پیامدهای واقعی دارد. اگر آزمایشگاه‌های مرزی ادعا کنند که نمایندگان آن‌ها می‌توانند تحقیقات را تسریع کنند در حالی که ارزیابی‌های مستقل و طراحی‌شده توسط متخصص نشان می‌دهد که نرخ‌های تفکیک تک رقمی تا ۳۰ درصد، تصمیم‌های تامین مالی، طرح‌های استخدام، و سیاست‌های آزمایشگاهی که بر اساس این ادعاها ساخته شده‌اند، خطا را به ارث می‌برند. معیارهای مستمر و متعلق به جامعه یک اصلاح کننده هستند: آنها ادعاهای مبهم را به اعداد قابل تکرار تبدیل می کنند.

سیگنالی برای مؤسسات تحقیقاتی

برای دانشگاه‌ها، آزمایشگاه‌های ملی، و تیم‌های تحقیق و توسعه که زمان استقرار عوامل را بررسی می‌کنند، این معیار چیزی را ارائه می‌دهد که نسخه‌های نمایشی فروشنده نمی‌توانند: اندازه‌گیری مبتنی بر جامعه از جایی که خط قابلیت اطمینان در واقع قرار دارد. نرخ تفکیک پذیری در نوجوانان یا بیست سالگی به این معنی است که امروزه بهتر است با این سیستم ها به عنوان دستیارهایی که نیاز به بازبینی دارند، برخورد شود، نه به عنوان مجریان مستقل خطوط لوله آزمایشی. دسته بندی وظایف - شامل علوم حیات، فیزیکی، زمین، ریاضیات و مهندسی - همچنین به متخصصان حوزه الگویی برای کمک به گردش کار از زمینه هایی می دهد که معیارهای عمومی به طور معمول نادیده می گیرند.

زمینه صنعت گسترده تر دلیل اهمیت زمان بندی را تقویت می کند. علم به یکی از پرطرفدارترین موارد استفاده برای هوش مصنوعی مرزی تبدیل شده است، زیرا آزمایشگاه‌ها در کشف مواد، علوم پروتئین و ریاضیات مشارکت دارند. ممیزی این ادعاها دشوار است: تأیید خروجی علمی کند است و شور و شوق سریعتر از تکرار حرکت می کند. معیاری که مصنوعات قابل تأیید را بر روی گردش‌های کاری واقعی درجه‌بندی می‌کند، به مؤسسات تحقیقاتی راهی می‌دهد تا قابلیت‌های نشان‌داده‌شده را از تئاتر نمایشی جدا کنند - و ردیابی کنند، انتشار با انتشار، آیا پیشرفت عامل در علم به همان سرعتی که در مهندسی نرم‌افزار، جایی که Terminal-Bench برای اولین بار نام خود را ساخت، ترکیب می‌شود یا خیر.

برای صنعت هوش مصنوعی، پیام v0.1 دو لبه است. مرز به وضوح در حال پیشرفت است - برج 30% Opus 5 بر 10.5% Opus 4.8 قدیمی تر است - اما سقف با قابلیت اطمینانی که آزمایشگاه های واقعی نیاز دارند فاصله دارد. طراحان این معیار می‌گویند که نسخه‌های معمولی دقیقاً سرعت کاهش این شکاف را بررسی می‌کنند. دانشمندانی که [روندهای نوظهور هوش مصنوعی] (https://aibuzzwire.news) را در ابزارهای تحقیقاتی عاملی مشاهده می کنند، اکنون معیاری دارند که خودشان ساخته اند.

---

از هوش مصنوعی جلوتر بمانید

آخرین اخبار، تحلیل ها و پیشرفت های هوش مصنوعی را دریافت کنید - همه در یک مکان.

بیشتر بخوانید اخبار هوش مصنوعی →