آنتروپیک از Claude Opus 5 رونمایی کرده است، یک مدل هوش مصنوعی جدید که شرکت می گوید هوش نزدیک به مرز را با تقریباً نصف قیمت مدل رده بالای Fable 5 خود ارائه می دهد. Opus 5 که در 24 ژوئیه 2026 منتشر شد، اکنون مدل پیشفرض کلود مکس و قویترین مدل موجود در کلود پرو است و آن را به عنوان اسب کاری روزمره Anthropic برای کدنویسی، عوامل مستقل و کار دانش حرفهای قرار میدهد.
پرتاب در لحظه ای انجام می شود که مشاغل در حال بررسی دقیق هزینه های هوش مصنوعی هستند. به گفته CNBC، مدل جدید "رقیب Fable 5 است و از آنجایی که مشاغل نگران هزینه ها هستند ارزان تر است" در حالی که بلومبرگ آن را به عنوان "مدل مقرون به صرفه تر برای کارهای روزمره" توصیف می کند. برای تیمهایی که آخرین [توسعههای هوش مصنوعی] (https://aibuzzwire.news) را دنبال میکنند، Opus 5 نشاندهنده شرطبندی عمدی است که میدان نبرد رقابتی بعدی ارزش است، نه برتری معیار خام.
عملکرد معیار: جدیدترین هنر در زمینه کدنویسی و کار دانش
Anthropic گزارش می دهد که Opus 5 نتایج پیشرفته ای را در زمینه کدگذاری و ارزیابی های کار دانش از جمله Frontier-Bench و GDPval-AA ارسال می کند. در نسخه Frontier-Bench نسخه 1.1، این شرکت میگوید که Opus 5 از تمام مدلهای دیگر پیشی گرفته و عملکرد نسخه قبلی خود، Opus 4.8 را با هزینه کمتر برای هر کار، بیش از دو برابر میکند.
بر اساس معیارهای خود Anthropic، در CursorBench 3.2، Opus 5 دارای 0.5 درصد از امتیاز اوج Fable 5 است در حالی که هزینه هر کار نصف آن است. Decrypt خاطرنشان کرد که این مدل "در اکثر معیارها - با نصف قیمت از Fable 5 پیشی می گیرد."
دستاوردها به ارزیابی های عاملی و حل مسئله گسترش می یابد:
- ARC-AGI 3: Opus 5 تقریباً سه برابر بیشتر از بهترین مدل بعدی در این تست جدید حل مسئله امتیاز می گیرد.
- Zapier AutomationBench: نرخ پاس حدود 1.5 برابر بهترین مدل بعدی برای همان هزینه، اندازهگیری تکمیل تکالیف تجاری.
- OSWorld 2.0 (استفاده از رایانه): Opus 5 با کمی بیش از یک سوم هزینه از بهترین نتیجه Fable 5 پیشی گرفت.
نکته قابل توجه، آنتروپیک اذعان میکند که Opus 5 «در زمینه وظایف امنیت سایبری پشت سر Mythos 5 باقی میماند»، منطقهای که یک مدل مرزی رقیب پیشتاز را حفظ میکند.
آژانس قوی تر و خود تأیید
یک موضوع تکراری در اعلامیه، توانایی بهبود یافته Opus 5 برای تأیید کار خود و تکرار تا زمانی است که موفق شود. آنتروپیک چندین نمونه از آزمایش دسترسی اولیه را توصیف کرد که این استقلال را برجسته می کند.
در یکی از کارهای Frontier-Bench، به مدل یک طراحی از یک قطعه ماشین داده شد و از آن خواسته شد تا کد بنویسد تا آن را به عنوان یک مدل FreeCAD 3 بعدی بازسازی کند - اما عمداً هیچ راهی برای مشاهده مستقیم نقاشی به او داده نشد. گزارش شده است که Opus 5 خط لوله بینایی کامپیوتری خود را برای استخراج هندسه از پیکسلهای خام نوشت، سپس قسمت کامل را بازسازی کرد و در جایی که هیچ مدل رقیب پس از پنج تلاش نتوانست این کار را حل کند، مکرراً موفق شد.
با توجه به یک باگ واقعی در یک مدیر بسته منبع باز محبوب، Opus 5 علت اصلی را پیدا کرد و یک مورد لبه ای را که پچ خود انجمن از دست داده بود، برطرف کرد، در حالی که یک مدل رقیب فقط علامت سطح را برطرف کرد و اعلام کرد که اشکال برطرف شده است. یک مهندس در یک شرکت بازرگانی بنا بر گزارشها از Opus 5 برای ایجاد یک خوراک دادههای بازار برای یک تبادل جدید در یک جلسه استفاده کرد - کاری که مدلهای قبلی اصلاً نمیتوانستند آن را انجام دهند - و با پیدا کردن هیچ فید زنده برای تأیید اعتبار، مدل مهار آزمایشی خود را ساخت.
پذیرش مشتری
شرکای دسترسی اولیه ارزیابیهای مثبتی ارائه کردند. اسکات وو، مدیر عامل Cognition (سازنده عامل کدنویسی Devin)، گفت که Opus 5 "با نصف هزینه به عملکرد سطح افسانه نزدیک می شود" و "قدرت خاصی در رفع اشکال و وظایف تجزیه و تحلیل ریشه ریشه ای" نشان می دهد. سواله آصف، یکی از بنیانگذاران Cursor، گفت که این مدل "هوش نزدیک به Fable 5 را با سرعت و هزینه Opus ارائه می دهد."
وید فاستر، مدیر عامل Zapier، گزارش داد که Opus 5 "بدون خرج کردن توکنهای بیشتری نسبت به مدلهای قبلی کلود، در صدر جدول امتیازات AutomationBench Zapier قرار گرفت" و یک گردش کار کامل برای جلوگیری از ریزش را تکمیل کرد - پرچمگذاری حسابهای در معرض خطر، هشدار به مالک مناسب و جمعبندی برای تیمهای نگهداری. مدل های قبلی قبول نشدند. Opus 5 به 100% رسید.
دستاوردها در تحقیقات علمی
Anthropic همچنین پیشرفت های Opus 5 را برای کارهای علمی برجسته کرد. این مدل در هر یک از ارزیابیهای علوم حیاتی Anthropic که زیستشناسی ساختاری، شیمی آلی و بیوانفورماتیک را پوشش میدهد، از Opus 4.8 بهتر عمل میکند. این شرکت به بهبود 10.2 درصدی در معیار شیمی آلی داخلی (استنتاج ساختارهای مولکولی از دادههای طیفسنجی) و افزایش 7.7 امتیازی در وظایف پیشبینی عملکرد پروتئین اشاره کرد. یکی از مشتریان ژنومیک این مدل را اینگونه توصیف کرد که "بیشتر شبیه یک دانشمند دقیق عمل می کند"، به دنبال آزمایش های آماری مناسب و بررسی متقابل نتایج خود است.
استراتژی قیمت گذاری
با قیمت گذاری Opus 5 در همان سطح Opus 4.8 در حالی که به هوش Fable 5 نزدیک می شود، آنتروپیک به طور موثر شکاف بین عرضه های سطح متوسط و پرچمدار خود را کاهش می دهد. VentureBeat این نسخه را بهعنوان «یک مدل هوش مصنوعی ارزانتر برای کدنویسی، عوامل و گردشهای کاری سازمانی» تعریف کرد و Seeking Alpha مشاهده کرد که Opus 5 «به مدل مرزی Fable 5 نزدیکتر و ارزانتر است». این شرکت یک تنظیم "تلاش" قابل تنظیم را ارائه می دهد که به مشتریان امکان می دهد هوش را با سرعت و هزینه های کمتر نشانه معامله کنند و نسبت هزینه به عملکرد را برای هر کار تنظیم کنند.
چه معنایی برای مسابقه هوش مصنوعی دارد
Opus 5 نشان می دهد که هزینه هوش مصنوعی نزدیک به مرز با چه سرعتی در حال کاهش است. مدلی که در فاصله قابل توجهی از توانمندترین سیستمهای موجود - با نصف قیمت توکن - قرار میگیرد، رقبا را تحت فشار قرار میدهد تا قیمتهای برتر را برای سودهای نهایی توجیه کنند. با رقابت Anthropic، OpenAI، Google و سایرین برای ایجاد مدلهای توانمند به اندازه کافی مقرون به صرفه برای استقرار روزانه و در مقیاس بزرگ، این سوال برای شرکتها در حال تغییر است که "کدام مدل هوشمندترین است؟" به "کدام مدل بیشترین هوش را در هر دلار ارائه می دهد؟"
برای آنتروپیک، پیام واضح است: استدلال سطح بالا دیگر یک محصول لوکس نیست. Opus 5 قابلیت مجاور مرزی را به قیمتی می رساند که استقرار پایدار و روزمره را واقعی می کند - و این ممکن است مهم ترین جزئیات باشد.
[از هوش مصنوعی جلوتر بمانید] (https://aibuzzwire.news)
Claude Opus 5 از امروز در Claude Pro، Claude Max و از طریق API Anthropic در دسترس است. برای اطلاعات بیشتر در مورد این داستان و چشم انداز گسترده تر هوش مصنوعی، با [اخبار جدید هوش مصنوعی] (https://aibuzzwire.news) همراه باشید.
اخبار هوش مصنوعی را بیشتر بخوانید →