آنتروپیک از Claude Opus 5 رونمایی کرده است، یک مدل هوش مصنوعی جدید که شرکت می گوید هوش نزدیک به مرز را با تقریباً نصف قیمت مدل رده بالای Fable 5 خود ارائه می دهد. Opus 5 که در 24 ژوئیه 2026 منتشر شد، اکنون مدل پیش‌فرض کلود مکس و قوی‌ترین مدل موجود در کلود پرو است و آن را به عنوان اسب کاری روزمره Anthropic برای کدنویسی، عوامل مستقل و کار دانش حرفه‌ای قرار می‌دهد.

پرتاب در لحظه ای انجام می شود که مشاغل در حال بررسی دقیق هزینه های هوش مصنوعی هستند. به گفته CNBC، مدل جدید "رقیب Fable 5 است و از آنجایی که مشاغل نگران هزینه ها هستند ارزان تر است" در حالی که بلومبرگ آن را به عنوان "مدل مقرون به صرفه تر برای کارهای روزمره" توصیف می کند. برای تیم‌هایی که آخرین [توسعه‌های هوش مصنوعی] (https://aibuzzwire.news) را دنبال می‌کنند، Opus 5 نشان‌دهنده شرط‌بندی عمدی است که میدان نبرد رقابتی بعدی ارزش است، نه برتری معیار خام.

عملکرد معیار: جدیدترین هنر در زمینه کدنویسی و کار دانش

Anthropic گزارش می دهد که Opus 5 نتایج پیشرفته ای را در زمینه کدگذاری و ارزیابی های کار دانش از جمله Frontier-Bench و GDPval-AA ارسال می کند. در نسخه Frontier-Bench نسخه 1.1، این شرکت می‌گوید که Opus 5 از تمام مدل‌های دیگر پیشی گرفته و عملکرد نسخه قبلی خود، Opus 4.8 را با هزینه کمتر برای هر کار، بیش از دو برابر می‌کند.

بر اساس معیارهای خود Anthropic، در CursorBench 3.2، Opus 5 دارای 0.5 درصد از امتیاز اوج Fable 5 است در حالی که هزینه هر کار نصف آن است. Decrypt خاطرنشان کرد که این مدل "در اکثر معیارها - با نصف قیمت از Fable 5 پیشی می گیرد."

دستاوردها به ارزیابی های عاملی و حل مسئله گسترش می یابد:

  • ARC-AGI 3: Opus 5 تقریباً سه برابر بیشتر از بهترین مدل بعدی در این تست جدید حل مسئله امتیاز می گیرد.
  • Zapier AutomationBench: نرخ پاس حدود 1.5 برابر بهترین مدل بعدی برای همان هزینه، اندازه‌گیری تکمیل تکالیف تجاری.
  • OSWorld 2.0 (استفاده از رایانه): Opus 5 با کمی بیش از یک سوم هزینه از بهترین نتیجه Fable 5 پیشی گرفت.

نکته قابل توجه، آنتروپیک اذعان می‌کند که Opus 5 «در زمینه وظایف امنیت سایبری پشت سر Mythos 5 باقی می‌ماند»، منطقه‌ای که یک مدل مرزی رقیب پیشتاز را حفظ می‌کند.

آژانس قوی تر و خود تأیید

یک موضوع تکراری در اعلامیه، توانایی بهبود یافته Opus 5 برای تأیید کار خود و تکرار تا زمانی است که موفق شود. آنتروپیک چندین نمونه از آزمایش دسترسی اولیه را توصیف کرد که این استقلال را برجسته می کند.

در یکی از کارهای Frontier-Bench، به مدل یک طراحی از یک قطعه ماشین داده شد و از آن خواسته شد تا کد بنویسد تا آن را به عنوان یک مدل FreeCAD 3 بعدی بازسازی کند - اما عمداً هیچ راهی برای مشاهده مستقیم نقاشی به او داده نشد. گزارش شده است که Opus 5 خط لوله بینایی کامپیوتری خود را برای استخراج هندسه از پیکسل‌های خام نوشت، سپس قسمت کامل را بازسازی کرد و در جایی که هیچ مدل رقیب پس از پنج تلاش نتوانست این کار را حل کند، مکرراً موفق شد.

با توجه به یک باگ واقعی در یک مدیر بسته منبع باز محبوب، Opus 5 علت اصلی را پیدا کرد و یک مورد لبه ای را که پچ خود انجمن از دست داده بود، برطرف کرد، در حالی که یک مدل رقیب فقط علامت سطح را برطرف کرد و اعلام کرد که اشکال برطرف شده است. یک مهندس در یک شرکت بازرگانی بنا بر گزارش‌ها از Opus 5 برای ایجاد یک خوراک داده‌های بازار برای یک تبادل جدید در یک جلسه استفاده کرد - کاری که مدل‌های قبلی اصلاً نمی‌توانستند آن را انجام دهند - و با پیدا کردن هیچ فید زنده برای تأیید اعتبار، مدل مهار آزمایشی خود را ساخت.

پذیرش مشتری

شرکای دسترسی اولیه ارزیابی‌های مثبتی ارائه کردند. اسکات وو، مدیر عامل Cognition (سازنده عامل کدنویسی Devin)، گفت که Opus 5 "با نصف هزینه به عملکرد سطح افسانه نزدیک می شود" و "قدرت خاصی در رفع اشکال و وظایف تجزیه و تحلیل ریشه ریشه ای" نشان می دهد. سواله آصف، یکی از بنیانگذاران Cursor، گفت که این مدل "هوش نزدیک به Fable 5 را با سرعت و هزینه Opus ارائه می دهد."

وید فاستر، مدیر عامل Zapier، گزارش داد که Opus 5 "بدون خرج کردن توکن‌های بیشتری نسبت به مدل‌های قبلی کلود، در صدر جدول امتیازات AutomationBench Zapier قرار گرفت" و یک گردش کار کامل برای جلوگیری از ریزش را تکمیل کرد - پرچم‌گذاری حساب‌های در معرض خطر، هشدار به مالک مناسب و جمع‌بندی برای تیم‌های نگهداری. مدل های قبلی قبول نشدند. Opus 5 به 100% رسید.

دستاوردها در تحقیقات علمی

Anthropic همچنین پیشرفت های Opus 5 را برای کارهای علمی برجسته کرد. این مدل در هر یک از ارزیابی‌های علوم حیاتی Anthropic که زیست‌شناسی ساختاری، شیمی آلی و بیوانفورماتیک را پوشش می‌دهد، از Opus 4.8 بهتر عمل می‌کند. این شرکت به بهبود 10.2 درصدی در معیار شیمی آلی داخلی (استنتاج ساختارهای مولکولی از داده‌های طیف‌سنجی) و افزایش 7.7 امتیازی در وظایف پیش‌بینی عملکرد پروتئین اشاره کرد. یکی از مشتریان ژنومیک این مدل را اینگونه توصیف کرد که "بیشتر شبیه یک دانشمند دقیق عمل می کند"، به دنبال آزمایش های آماری مناسب و بررسی متقابل نتایج خود است.

استراتژی قیمت گذاری

با قیمت گذاری Opus 5 در همان سطح Opus 4.8 در حالی که به هوش Fable 5 نزدیک می شود، آنتروپیک به طور موثر شکاف بین عرضه های سطح متوسط و پرچمدار خود را کاهش می دهد. VentureBeat این نسخه را به‌عنوان «یک مدل هوش مصنوعی ارزان‌تر برای کدنویسی، عوامل و گردش‌های کاری سازمانی» تعریف کرد و Seeking Alpha مشاهده کرد که Opus 5 «به مدل مرزی Fable 5 نزدیک‌تر و ارزان‌تر است». این شرکت یک تنظیم "تلاش" قابل تنظیم را ارائه می دهد که به مشتریان امکان می دهد هوش را با سرعت و هزینه های کمتر نشانه معامله کنند و نسبت هزینه به عملکرد را برای هر کار تنظیم کنند.

چه معنایی برای مسابقه هوش مصنوعی دارد

Opus 5 نشان می دهد که هزینه هوش مصنوعی نزدیک به مرز با چه سرعتی در حال کاهش است. مدلی که در فاصله قابل توجهی از توانمندترین سیستم‌های موجود - با نصف قیمت توکن - قرار می‌گیرد، رقبا را تحت فشار قرار می‌دهد تا قیمت‌های برتر را برای سودهای نهایی توجیه کنند. با رقابت Anthropic، OpenAI، Google و سایرین برای ایجاد مدل‌های توانمند به اندازه کافی مقرون به صرفه برای استقرار روزانه و در مقیاس بزرگ، این سوال برای شرکت‌ها در حال تغییر است که "کدام مدل هوشمندترین است؟" به "کدام مدل بیشترین هوش را در هر دلار ارائه می دهد؟"

برای آنتروپیک، پیام واضح است: استدلال سطح بالا دیگر یک محصول لوکس نیست. Opus 5 قابلیت مجاور مرزی را به قیمتی می رساند که استقرار پایدار و روزمره را واقعی می کند - و این ممکن است مهم ترین جزئیات باشد.

[از هوش مصنوعی جلوتر بمانید] (https://aibuzzwire.news)

Claude Opus 5 از امروز در Claude Pro، Claude Max و از طریق API Anthropic در دسترس است. برای اطلاعات بیشتر در مورد این داستان و چشم انداز گسترده تر هوش مصنوعی، با [اخبار جدید هوش مصنوعی] (https://aibuzzwire.news) همراه باشید.

اخبار هوش مصنوعی را بیشتر بخوانید →