شرکت اروپایی Multiverse Computing، Quasar 438B را راهاندازی کرده است، یک مدل استدلالی بزرگ که به گفته این شرکت، هوشمندترین مدل هوش مصنوعی ساخته شده در اروپا است. طبق اعلام این شرکت، Quasar 438B در شاخص هوش آنالیز مصنوعی امتیاز 43 را کسب کرده است که بالاترین نتیجه در بین هر مدل اروپایی اندازه گیری شده بر روی آن معیار است.
این راه اندازی یک گام مهم برای این شرکت اسپانیایی است که شهرت خود را بر روی فشرده سازی مدل هوش مصنوعی به جای آموزش سیستم های مقیاس مرزی ایجاد کرد. Quasar 438B اولین مدل بزرگی است که Multiverse Computing منتشر کرده است و زمانی که دولتها و شرکتهای اروپایی تلاش میکنند قابلیت هوش مصنوعی که کاملاً به آزمایشگاههای آمریکایی و چینی وابسته نیست، وارد بازار شود. برای خوانندگانی که پوشش خبری هوش مصنوعی ما را دنبال می کنند، این انتشار همچنین نشان می دهد که رقابت برای کاهش فاصله با مدل های مرزی دیگر محدود به رقبای معمول ایالات متحده نیست.
Quasar 438B در واقع چه امتیازی می گیرد
شاخص هوش مصنوعی تجزیه و تحلیل (نسخه 4.1.1) نه ارزیابی از جمله GDPval-AA v2، tau3-Banking، Terminal-Bench v2.1، SciCode، Humanity's Last Exam، GPQA Diamond، CritPt، AA-Omniscience و AA-Aa-LCR را ترکیب می کند. امتیاز ترکیبی Quasar 438B با امتیاز 43، آن را بالاتر از Mistral Medium 3.5 در 30، Nemotron 3 Ultra انویدیا با 38 و Inkling با 42 قرار می دهد.
حوزه وسیعتر همچنان به مرزهای آمریکا تعلق دارد: کلود اوپوس 5 با رتبه 63 پیشتاز است. در عوض، این شرکت Quasar 438B را به عنوان قویترین گزینه اروپایی معرفی میکند که در هفت مورد از هشت ارزیابی تحلیل مصنوعی انتخابی که برجسته کرده، از مدلهای اروپایی قابل مقایسه بهتر عمل میکند.
سرعت استدلال دوم است
امتیازات معیار خام فقط نیمی از پیشرفت Multiverse Computing است. این شرکت می گوید Quasar 438B 500 توکن را با احتساب زمان فکر کردن در 15.3 ثانیه برمی گرداند. در میان مدلهای موجود در مقایسه، فقط Nemotron 3.5 Lightning (9.4 ثانیه)، Gemini 3.5 Flash-Lite (10.8 ثانیه) و Gemini 3.7 Flash (11.5 ثانیه) سریعتر هستند و فقط Gemini 3.7 Flash هم سریعتر و هم توانایی بیشتری در ایندکس دارد.
مقایسه با Mistral Medium 3.5 در هر دو محور یک طرفه انجام میشود: Quasar امتیاز بالاتر (43 در مقابل 30) و سریعتر پاسخ میدهد (15.3 ثانیه در مقابل 18.8 ثانیه). Inkling، که تقریباً با هوش Quasar در 42 مطابقت دارد، برای همان پاسخ 500 توکن به 48.3 ثانیه نیاز دارد که بیش از سه برابر بیشتر است.
استدلال طولانی مدت قوی
یک نتیجه از این اعلامیه برجسته است: در AA-LCR، ارزیابی که توانایی استخراج، اتصال و استدلال بر روی اطلاعات پخش شده در اسناد طولانی را آزمایش می کند، Quasar 438B امتیاز 75.0 را کسب می کند. طبق ارقام این شرکت، این میزان با Grok 4.6 (بالا)، در یک نقطه از Claude Opus 5 در 75.7 و بالاتر از Qwen3.8 2.4T A95B در 75.3 است.
رسیدگی به زمینههای طولانی اهمیت دارد زیرا تحقیقات سازمانی، تجزیه و تحلیل اسناد و جریانهای کاری عاملی بر روی آن ساخته شدهاند. اگر یک مدل نتواند اطلاعات را در یک سند طولانی نگه دارد و به آن متصل کند، نمیتواند ابزارهای چند مرحلهای را که شرکتها واقعاً میخواهند استفاده کنند، نیرو میدهد. این جایی است که Quasar به گروه مرزی نزدیکتر میشود.
کدنویسی عاملی هنوز فضای اصلی دارد
ضعیف ترین نتیجه در اعلامیه، Terminal-Bench v2.1 است که عامل های کدنویسی را در محیط های ترمینال واقعی کار می کند. Quasar 438B امتیاز 69.3 را به دست آورده است که با امتیاز 18.7 با Mistral Medium 3.5 و Nemotron 3 Ultra با امتیاز 15.4 پیشتاز است، اما پس از گروه مرزی به رهبری Claude Opus 5 با امتیاز 89.1 قرار دارد. Multiverse Computing اذعان میکند که این ارزیابی با بیشترین فضا است و میگوید دور بعدی کار بر روی آن است.
ساخته شده برای عوامل سازمانی
Quasar 438B به عنوان یک مدل برای سازمانهایی که عوامل توسعه نرمافزار، خلبانهای فنی، سیستمهای تحقیقاتی و اتوماسیون گردش کار را اجرا میکنند، قرار میگیرد. این کلاس در کلاس 400 میلیارد پارامتر پلاس قرار دارد، انگلیسی و اسپانیایی را مدیریت می کند و برای کارهای چند مرحله ای که نیاز به برنامه ریزی، استفاده از ابزار، اجرای کد و زمینه بزرگ بدون تأخیر معمول کلاس دارند، طراحی شده است.
دسترسی از طریق CompactifAI API شرکت اجرا میشود، بنابراین تیمها میتوانند مدل را بدون ایستادن زیرساختهای خود آزمایش کنند. Multiverse Computing می گوید به روز رسانی های بیشتری برای Quasar در راه است.
چه معنایی برای مسابقه هوش مصنوعی اروپا دارد
این نسخه در لحظه ای عجیب برای هوش مصنوعی اروپایی قرار می گیرد. میسترال، که مدتها پرچمدار این قاره بود، با سؤالاتی در مورد جهتگیری خود مواجه بود، در حالی که آزمایشگاههای ایالات متحده برتری خود را در معیارهای ترکیبی تثبیت کردهاند. یک مدل اروپایی که به طور قانونی در صدر زمینه اروپایی در یک شاخص مستقل قرار دارد، به شرکتهای این قاره یک گزینه منطقهای معتبر، به ویژه برای استقرار دو زبانه انگلیسی-اسپانیایی، میدهد.
اینکه Quasar 438B این موقعیت را دارد یا نه، موضوع دیگری است. خود شرکت خاطرنشان می کند که تنها کسری از رهبران شاخص سریعتر پاسخ می دهند و فاصله نسبت به کلود اوپوس 5 بیست امتیاز باقی می ماند. اما شرکت اول فشرده سازی اکنون نشان داده است که می تواند در کلاس سنگین وزن رقابت کند و شرکت های اروپایی سرانجام مدلی در بازار خانگی دارند که ارزش محک زدن در برابر پیش فرض های ایالات متحده را دارد.
از هوش مصنوعی جلوتر بمانید
چشم انداز هوش مصنوعی ساعت به ساعت تغییر می کند و شاخص های شاخصی که در ژانویه غیرقابل نفوذ به نظر می رسیدند تا تابستان از بین می روند. [اخبار هوش مصنوعی را در AI Buzz Wire بخوانید] (https://aibuzzwire.news) برای ردیابی هر نسخه مدل، نتایج معیار و تغییر سیاست در صورت وقوع.
[آخرین تحولات هوش مصنوعی را در اینجا دنبال کنید] (https://aibuzzwire.news).
