شرکت اروپایی Multiverse Computing، Quasar 438B را راه‌اندازی کرده است، یک مدل استدلالی بزرگ که به گفته این شرکت، هوشمندترین مدل هوش مصنوعی ساخته شده در اروپا است. طبق اعلام این شرکت، Quasar 438B در شاخص هوش آنالیز مصنوعی امتیاز 43 را کسب کرده است که بالاترین نتیجه در بین هر مدل اروپایی اندازه گیری شده بر روی آن معیار است.

این راه اندازی یک گام مهم برای این شرکت اسپانیایی است که شهرت خود را بر روی فشرده سازی مدل هوش مصنوعی به جای آموزش سیستم های مقیاس مرزی ایجاد کرد. Quasar 438B اولین مدل بزرگی است که Multiverse Computing منتشر کرده است و زمانی که دولت‌ها و شرکت‌های اروپایی تلاش می‌کنند قابلیت هوش مصنوعی که کاملاً به آزمایشگاه‌های آمریکایی و چینی وابسته نیست، وارد بازار شود. برای خوانندگانی که پوشش خبری هوش مصنوعی ما را دنبال می کنند، این انتشار همچنین نشان می دهد که رقابت برای کاهش فاصله با مدل های مرزی دیگر محدود به رقبای معمول ایالات متحده نیست.

Quasar 438B در واقع چه امتیازی می گیرد

شاخص هوش مصنوعی تجزیه و تحلیل (نسخه 4.1.1) نه ارزیابی از جمله GDPval-AA v2، tau3-Banking، Terminal-Bench v2.1، SciCode، Humanity's Last Exam، GPQA Diamond، CritPt، AA-Omniscience و AA-Aa-LCR را ترکیب می کند. امتیاز ترکیبی Quasar 438B با امتیاز 43، آن را بالاتر از Mistral Medium 3.5 در 30، Nemotron 3 Ultra انویدیا با 38 و Inkling با 42 قرار می دهد.

حوزه وسیع‌تر همچنان به مرزهای آمریکا تعلق دارد: کلود اوپوس 5 با رتبه 63 پیشتاز است. در عوض، این شرکت Quasar 438B را به عنوان قوی‌ترین گزینه اروپایی معرفی می‌کند که در هفت مورد از هشت ارزیابی تحلیل مصنوعی انتخابی که برجسته کرده، از مدل‌های اروپایی قابل مقایسه بهتر عمل می‌کند.

سرعت استدلال دوم است

امتیازات معیار خام فقط نیمی از پیشرفت Multiverse Computing است. این شرکت می گوید Quasar 438B 500 توکن را با احتساب زمان فکر کردن در 15.3 ثانیه برمی گرداند. در میان مدل‌های موجود در مقایسه، فقط Nemotron 3.5 Lightning (9.4 ثانیه)، Gemini 3.5 Flash-Lite (10.8 ثانیه) و Gemini 3.7 Flash (11.5 ثانیه) سریع‌تر هستند و فقط Gemini 3.7 Flash هم سریع‌تر و هم توانایی بیشتری در ایندکس دارد.

مقایسه با Mistral Medium 3.5 در هر دو محور یک طرفه انجام می‌شود: Quasar امتیاز بالاتر (43 در مقابل 30) و سریع‌تر پاسخ می‌دهد (15.3 ثانیه در مقابل 18.8 ثانیه). Inkling، که تقریباً با هوش Quasar در 42 مطابقت دارد، برای همان پاسخ 500 توکن به 48.3 ثانیه نیاز دارد که بیش از سه برابر بیشتر است.

استدلال طولانی مدت قوی

یک نتیجه از این اعلامیه برجسته است: در AA-LCR، ارزیابی که توانایی استخراج، اتصال و استدلال بر روی اطلاعات پخش شده در اسناد طولانی را آزمایش می کند، Quasar 438B امتیاز 75.0 را کسب می کند. طبق ارقام این شرکت، این میزان با Grok 4.6 (بالا)، در یک نقطه از Claude Opus 5 در 75.7 و بالاتر از Qwen3.8 2.4T A95B در 75.3 است.

رسیدگی به زمینه‌های طولانی اهمیت دارد زیرا تحقیقات سازمانی، تجزیه و تحلیل اسناد و جریان‌های کاری عاملی بر روی آن ساخته شده‌اند. اگر یک مدل نتواند اطلاعات را در یک سند طولانی نگه دارد و به آن متصل کند، نمی‌تواند ابزارهای چند مرحله‌ای را که شرکت‌ها واقعاً می‌خواهند استفاده کنند، نیرو می‌دهد. این جایی است که Quasar به گروه مرزی نزدیک‌تر می‌شود.

کدنویسی عاملی هنوز فضای اصلی دارد

ضعیف ترین نتیجه در اعلامیه، Terminal-Bench v2.1 است که عامل های کدنویسی را در محیط های ترمینال واقعی کار می کند. Quasar 438B امتیاز 69.3 را به دست آورده است که با امتیاز 18.7 با Mistral Medium 3.5 و Nemotron 3 Ultra با امتیاز 15.4 پیشتاز است، اما پس از گروه مرزی به رهبری Claude Opus 5 با امتیاز 89.1 قرار دارد. Multiverse Computing اذعان می‌کند که این ارزیابی با بیشترین فضا است و می‌گوید دور بعدی کار بر روی آن است.

ساخته شده برای عوامل سازمانی

Quasar 438B به عنوان یک مدل برای سازمان‌هایی که عوامل توسعه نرم‌افزار، خلبان‌های فنی، سیستم‌های تحقیقاتی و اتوماسیون گردش کار را اجرا می‌کنند، قرار می‌گیرد. این کلاس در کلاس 400 میلیارد پارامتر پلاس قرار دارد، انگلیسی و اسپانیایی را مدیریت می کند و برای کارهای چند مرحله ای که نیاز به برنامه ریزی، استفاده از ابزار، اجرای کد و زمینه بزرگ بدون تأخیر معمول کلاس دارند، طراحی شده است.

دسترسی از طریق CompactifAI API شرکت اجرا می‌شود، بنابراین تیم‌ها می‌توانند مدل را بدون ایستادن زیرساخت‌های خود آزمایش کنند. Multiverse Computing می گوید به روز رسانی های بیشتری برای Quasar در راه است.

چه معنایی برای مسابقه هوش مصنوعی اروپا دارد

این نسخه در لحظه ای عجیب برای هوش مصنوعی اروپایی قرار می گیرد. میسترال، که مدت‌ها پرچمدار این قاره بود، با سؤالاتی در مورد جهت‌گیری خود مواجه بود، در حالی که آزمایشگاه‌های ایالات متحده برتری خود را در معیارهای ترکیبی تثبیت کرده‌اند. یک مدل اروپایی که به طور قانونی در صدر زمینه اروپایی در یک شاخص مستقل قرار دارد، به شرکت‌های این قاره یک گزینه منطقه‌ای معتبر، به ویژه برای استقرار دو زبانه انگلیسی-اسپانیایی، می‌دهد.

اینکه Quasar 438B این موقعیت را دارد یا نه، موضوع دیگری است. خود شرکت خاطرنشان می کند که تنها کسری از رهبران شاخص سریعتر پاسخ می دهند و فاصله نسبت به کلود اوپوس 5 بیست امتیاز باقی می ماند. اما شرکت اول فشرده سازی اکنون نشان داده است که می تواند در کلاس سنگین وزن رقابت کند و شرکت های اروپایی سرانجام مدلی در بازار خانگی دارند که ارزش محک زدن در برابر پیش فرض های ایالات متحده را دارد.

از هوش مصنوعی جلوتر بمانید

چشم انداز هوش مصنوعی ساعت به ساعت تغییر می کند و شاخص های شاخصی که در ژانویه غیرقابل نفوذ به نظر می رسیدند تا تابستان از بین می روند. [اخبار هوش مصنوعی را در AI Buzz Wire بخوانید] (https://aibuzzwire.news) برای ردیابی هر نسخه مدل، نتایج معیار و تغییر سیاست در صورت وقوع.

[آخرین تحولات هوش مصنوعی را در اینجا دنبال کنید] (https://aibuzzwire.news).