یک معیار جدید نحوه سنجش توانایی های علمی صنعت هوش مصنوعی را به چالش می کشد و اولین نتایج آن برای آزمایشگاه های مرزی فروتن است. Terminal-Bench-Science 0.1 که این هفته توسط محققان دانشگاه استنفورد و تیم پشتیبان معیار کدنویسی محبوب Terminal-Bench راهاندازی شد، عوامل هوش مصنوعی را بر روی گردشهای کاری تحقیقاتی علمی واقعی که توسط دانشمندان شاغل ارائه شده است، ارزیابی میکند - و قویترین مدل آزمایششده، Claude Opus 5 است که از طریق Claude Code انجام میشود، و تنها 30 کار را انجام میدهد.
صفحه اعلام معیار، اصل راهنمای آن را به صراحت شرح می دهد: دانشمندان، نه توسعه دهندگان مدل یا فروشندگان داده، باید نوار توانایی علمی در هوش مصنوعی را تعیین کنند. این پروژه با همکاری کارشناسان حوزه از موسسات تحقیقاتی در سراسر جهان ساخته شده است و اولین نسخه آن شامل 70 وظیفه است که شامل علوم زیستی، فیزیک، علوم زمین، ریاضیات و مهندسی می شود.
تفاوت آن با معیارهای کتاب درسی
بیشتر ارزیابیهای علمی هوش مصنوعی دانش را آزمایش میکنند: سؤالات چند گزینهای، مسائل کتاب درسی، تمرینهای استاندارد. Terminal-Bench-Science در عوض اندازهگیری میکند که آیا عوامل میتوانند جریانهای کاری سختگیرانه و زمانبر را که روزهای واقعی محققین را پر میکند، اجرا کنند - کاری که در هیچ امتحانی ظاهر نمیشود. وظایف در محیطهای واقعگرایانه اجرا میشوند و درجهبندی بر اساس مصنوعات عینی است: تحلیلها، شبیهسازیها، اثباتها، کدها و محصولات دادهای که به جای قضاوت در مدلها یا امتیازدهی چندگزینهای، با آزمونهای تکلیفی قابل تکرار بررسی میشوند.
این طراحی منعکس کننده یک نظریه است که دستیاران هوش مصنوعی در نهایت باید برای علم انجام دهند. بهجای جایگزینی قضاوت علمی، نویسندگان معیار استدلال میکنند، عوامل باید لایه اجرا را در دست بگیرند - اجرای آزمایشها در سیلیکو، پردازش دادهها، بررسی شواهد - تا دانشمندان را برای بخشهایی از تحقیق که قضاوت انسانی در آنها اهمیت بیشتری دارد: تعریف سؤالات، شکلدهی فرضیهها، یافتن نتایج و تفسیر نتایج، آزاد کنند.
این پروژه همچنین به صراحت به عنوان یک هدف متحرک ساخته شده است. در جایی که بسیاری از معیارها یک بار منتشر می شوند و رها می شوند - در اطلاعیه این مشکل "مقالاتی برای انتشار" نامیده می شود - Terminal-Bench-Science به عنوان معیاری پیوسته طراحی شده است که در کنار مرز تکامل می یابد، با انتشارات منظم که هدف آن حفظ ارزیابی پیش از پیشرفت مدل و جلوگیری از تورم امتیاز ناشی از آلودگی است.
اولین تابلوی برتر: راه طولانی تا قابل اعتماد بودن
تابلوی امتیازات نسخه 1، که با رسیدن به اخبار هکر این هفته توجه قابل توجهی را به خود جلب کرد، افت شدیدی را از بالا نشان می دهد:
- Claude Opus 5 (Claude Code): 30.0%
- GPT-5.6 Sol (Codex): 22.4٪
- Claude Fable 5 (Claude Code): 21.4%
- Claude Opus 4.8 (Claude Code): 10.5%
- GPT-5.6 Terra (Codex): 8.6٪
- GLM 5.3 (Claude Code): 8.1%
- Kimi K3 (Claude Code): 7.1%
- Grok 4.6 (Grok Build): 7.1%
- GPT-5.6 Luna (Codex): 3.3٪
نتایج نشان میدهد که جریانهای کاری علمی برای عاملها بهطور قابلتوجهی سختتر از مهندسی نرمافزار باقی میماند، جایی که معیارهای اصلی Terminal-Bench و کدنویسی رقیب شاهد افزایش سریع امتیازات بودهاند. نرخ تفکیک 30% برای بهترین سیستم موجود به این معنی است که در هفت مورد از 10 کار تحقیقاتی واقعی، حتی یک عامل رده بالا که با یک مهار قوی جفت شده است، نمی تواند کار صحیح قابل تاییدی تولید کند.
گسترش در خانواده های الگو نیز آموزنده است. فاصله بین Claude Opus 5 و Claude Opus 4.8 - تقریباً بیست امتیاز - و بین انواع GPT-5.6 Sol، Terra و Luna نشان می دهد که کیفیت نتیجه تا چه حد به تعامل مدل و مهار عامل بستگی دارد، نه به هوش مدل خام. هر ورودی با امتیاز بالا از یک مهار کدگذاری عاملی (Claude Code، Codex، Grok Build) استفاده می کند، که این اجماع در حال ظهور را تقویت می کند که داربست به اندازه وزن های اساسی تعیین کننده است.
چرا دانشمندان معیار خود را ساختند
چارچوب بندی معیار دارای یک استدلال نهادی ظریف است. در این اطلاعیه آمده است: "مخاطرات علم بسیار زیاد است و معیارهای آن باید اولویت های جامعه علمی را به جای منافع بیرونی منعکس کند." این پروژه به محققین شاغل مکانیزمی مستقیم می دهد تا وظایفی را که واقعاً به آنها نیاز دارند به صورت خودکار رمزگذاری کنند - و ادعاهای فروشندگان مبنی بر "شتاب بخشیدن به کشف علمی" را در مقابل یک استاندارد قابل تایید نگه دارند.
این مهم است زیرا شکاف بین بازاریابی و واقعیت پیامدهای واقعی دارد. اگر آزمایشگاههای مرزی ادعا کنند که نمایندگان آنها میتوانند تحقیقات را تسریع کنند در حالی که ارزیابیهای مستقل و طراحیشده توسط متخصص نشان میدهد که نرخهای تفکیک تک رقمی تا ۳۰ درصد، تصمیمهای تامین مالی، طرحهای استخدام، و سیاستهای آزمایشگاهی که بر اساس این ادعاها ساخته شدهاند، خطا را به ارث میبرند. معیارهای مستمر و متعلق به جامعه یک اصلاح کننده هستند: آنها ادعاهای مبهم را به اعداد قابل تکرار تبدیل می کنند.
سیگنالی برای مؤسسات تحقیقاتی
برای دانشگاهها، آزمایشگاههای ملی، و تیمهای تحقیق و توسعه که زمان استقرار عوامل را بررسی میکنند، این معیار چیزی را ارائه میدهد که نسخههای نمایشی فروشنده نمیتوانند: اندازهگیری مبتنی بر جامعه از جایی که خط قابلیت اطمینان در واقع قرار دارد. نرخ تفکیک پذیری در نوجوانان یا بیست سالگی به این معنی است که امروزه بهتر است با این سیستم ها به عنوان دستیارهایی که نیاز به بازبینی دارند، برخورد شود، نه به عنوان مجریان مستقل خطوط لوله آزمایشی. دسته بندی وظایف - شامل علوم حیات، فیزیکی، زمین، ریاضیات و مهندسی - همچنین به متخصصان حوزه الگویی برای کمک به گردش کار از زمینه هایی می دهد که معیارهای عمومی به طور معمول نادیده می گیرند.
زمینه صنعت گسترده تر دلیل اهمیت زمان بندی را تقویت می کند. علم به یکی از پرطرفدارترین موارد استفاده برای هوش مصنوعی مرزی تبدیل شده است، زیرا آزمایشگاهها در کشف مواد، علوم پروتئین و ریاضیات مشارکت دارند. ممیزی این ادعاها دشوار است: تأیید خروجی علمی کند است و شور و شوق سریعتر از تکرار حرکت می کند. معیاری که مصنوعات قابل تأیید را بر روی گردشهای کاری واقعی درجهبندی میکند، به مؤسسات تحقیقاتی راهی میدهد تا قابلیتهای نشاندادهشده را از تئاتر نمایشی جدا کنند - و ردیابی کنند، انتشار با انتشار، آیا پیشرفت عامل در علم به همان سرعتی که در مهندسی نرمافزار، جایی که Terminal-Bench برای اولین بار نام خود را ساخت، ترکیب میشود یا خیر.
برای صنعت هوش مصنوعی، پیام v0.1 دو لبه است. مرز به وضوح در حال پیشرفت است - برج 30% Opus 5 بر 10.5% Opus 4.8 قدیمی تر است - اما سقف با قابلیت اطمینانی که آزمایشگاه های واقعی نیاز دارند فاصله دارد. طراحان این معیار میگویند که نسخههای معمولی دقیقاً سرعت کاهش این شکاف را بررسی میکنند. دانشمندانی که [روندهای نوظهور هوش مصنوعی] (https://aibuzzwire.news) را در ابزارهای تحقیقاتی عاملی مشاهده می کنند، اکنون معیاری دارند که خودشان ساخته اند.
---
از هوش مصنوعی جلوتر بمانیدآخرین اخبار، تحلیل ها و پیشرفت های هوش مصنوعی را دریافت کنید - همه در یک مکان.
بیشتر بخوانید اخبار هوش مصنوعی →