Perusahaan AI Eropa Multiverse Computing telah meluncurkan Quasar 438B, model penalaran besar yang menurut perusahaan adalah model AI paling cerdas yang dibuat di Eropa. Menurut pengumuman perusahaan, Quasar 438B mendapat skor 43 pada Indeks Kecerdasan Analisis Buatan, hasil tertinggi dari semua model Eropa yang diukur pada tolok ukur tersebut.
Peluncuran ini menandai langkah signifikan bagi perusahaan asal Spanyol tersebut, yang membangun reputasinya pada kompresi model AI dibandingkan melatih sistem skala terdepan. Quasar 438B adalah model besar pertama yang dirilis Multiverse Computing, dan hadir saat pemerintah dan perusahaan Eropa mendorong kemampuan AI yang tidak bergantung sepenuhnya pada laboratorium Amerika dan Tiongkok. Bagi pembaca yang mengikuti liputan berita AI kami, rilis ini juga menandakan bahwa persaingan untuk menutup kesenjangan dengan model terdepan tidak lagi terbatas pada pesaing AS pada umumnya.
Berapa Skor Quasar 438B Sebenarnya
Indeks Kecerdasan Analisis Buatan (versi 4.1.1) menggabungkan sembilan evaluasi, termasuk GDPval-AA v2, tau3-Banking, Terminal-Bench v2.1, SciCode, Ujian Terakhir Kemanusiaan, GPQA Diamond, CritPt, AA-Omniscience, dan AA-LCR. Skor komposit Quasar 438B sebesar 43 menempatkannya di depan Mistral Medium 3.5 dengan skor 30, Nemotron 3 Ultra dari NVIDIA pada skor 38, dan Inkling pada skor 42, sesuai pengumuman perusahaan.
Bidang yang lebih luas masih menjadi milik perbatasan Amerika: Claude Opus 5 memimpin indeks di 63. Multiverse Computing tidak mengklaim sebaliknya. Sebaliknya, perusahaan membingkai Quasar 438B sebagai opsi Eropa terkuat, mengungguli model Eropa yang sebanding pada tujuh dari delapan evaluasi Analisis Buatan terpilih yang disoroti.
Kecepatan Adalah Argumen Kedua
Skor benchmark mentah hanya setengah dari nilai Multiverse Computing. Perusahaan mengatakan Quasar 438B mengembalikan 500 token, termasuk waktu berpikir, dalam 15,3 detik. Di antara model-model yang dibandingkan, hanya Nemotron 3.5 Lightning (9,4 detik), Gemini 3.5 Flash-Lite (10,8 detik) dan Gemini 3.7 Flash (11,5 detik) yang lebih cepat, dan hanya Gemini 3.7 Flash yang lebih cepat dan lebih mumpuni dalam indeks.
Perbandingan dengan Mistral Medium 3.5 berjalan satu arah pada kedua sumbu: Quasar mendapat skor lebih tinggi (43 berbanding 30) dan menjawab lebih cepat (15,3 detik berbanding 18,8 detik). Inkling, yang hampir menyamai kecerdasan Quasar di usia 42, membutuhkan 48,3 detik untuk respons 500 token yang sama, lebih dari tiga kali lipat durasinya.
Penalaran Konteks Panjang yang Kuat
Salah satu hasil yang menonjol dari pengumuman tersebut: pada AA-LCR, evaluasi yang menguji kemampuan mengekstraksi, menghubungkan, dan menalar informasi yang tersebar di dokumen panjang, Quasar 438B mendapat skor 75,0. Itu setara dengan Grok 4.6 (tertinggi), satu poin dari Claude Opus 5 di 75.7, dan di depan Qwen3.8 2.4T A95B di 75.3, menurut angka perusahaan.
Penanganan konteks panjang penting karena penelitian perusahaan, analisis dokumen, dan alur kerja agen dibangun berdasarkan hal tersebut. Jika suatu model tidak dapat menyimpan dan menghubungkan informasi di seluruh dokumen yang panjang, model tersebut tidak dapat mendukung alat multi-langkah yang sebenarnya ingin diterapkan oleh perusahaan. Di sinilah Quasar paling dekat dengan kelompok perbatasan.
Pengodean Agentik Masih Memiliki Ruang Kepala
Hasil terlemah dalam pengumuman ini adalah Terminal-Bench v2.1, yang membuat agen pengkodean bekerja di lingkungan terminal nyata. Quasar 438B mendapat skor 69,3, memimpin Mistral Medium 3,5 dengan 18,7 poin dan Nemotron 3 Ultra dengan 15,4, tetapi tertinggal dari grup perbatasan yang dipimpin oleh Claude Opus 5 dengan 89,1. Multiverse Computing mengakui bahwa ini adalah evaluasi yang memiliki ruang terbesar dan mengatakan bahwa putaran pekerjaan berikutnya ditujukan untuk hal tersebut.
Dibuat untuk Agen Perusahaan
Quasar 438B diposisikan sebagai model bagi organisasi yang menjalankan agen pengembangan perangkat lunak, kopilot teknis, sistem penelitian, dan otomatisasi alur kerja. Ia berada di kelas dengan 400 miliar parameter lebih, menangani bahasa Inggris dan Spanyol, dan dirancang untuk tugas multi-langkah yang memerlukan perencanaan, penggunaan alat, eksekusi kode, dan konteks besar tanpa latensi yang biasanya dimiliki kelas.
Akses dijalankan melalui API CompactifAI perusahaan, sehingga tim dapat menguji model tanpa harus menyiapkan infrastruktur mereka sendiri. Multiverse Computing mengatakan lebih banyak pembaruan untuk Quasar akan datang.
Apa Artinya bagi Perlombaan AI Eropa
Rilis ini terjadi pada momen yang tidak biasa bagi AI Eropa. Mistral, yang sudah lama menjadi standar di benua ini, menghadapi pertanyaan tentang arahnya, sementara laboratorium AS telah mengkonsolidasikan keunggulan mereka dalam tolok ukur komposit. Model Eropa yang secara sah mengungguli Eropa dalam indeks independen memberikan perusahaan-perusahaan di benua ini pilihan regional yang kredibel, khususnya untuk penerapan bilingual Inggris-Spanyol.
Apakah Quasar 438B memegang posisi itu adalah soal lain. Perusahaan itu sendiri mencatat bahwa hanya sebagian kecil dari pemimpin indeks yang menjawab lebih cepat, dan kesenjangan dengan Claude Opus 5 tetap lebar dua puluh poin. Namun perusahaan yang mengutamakan kompresi kini telah menunjukkan bahwa mereka mampu bersaing di kelas kelas berat, dan perusahaan-perusahaan Eropa akhirnya memiliki model pasar dalam negeri yang layak dijadikan patokan terhadap kegagalan mereka di AS.
Tetap Terdepan dalam AI
Lanskap AI berubah dari waktu ke waktu, dan prospek acuan yang tampak tidak dapat disangkal pada bulan Januari akan hilang pada musim panas. Baca berita AI selengkapnya di AI Buzz Wire untuk melacak setiap rilis model, hasil tolok ukur, dan perubahan kebijakan yang terjadi.
Ikuti perkembangan AI terkini di sini.