Công ty AI Châu Âu Multiverse Computing đã ra mắt Quasar 438B, một mô hình lý luận lớn mà công ty cho biết là mô hình AI thông minh nhất được xây dựng ở Châu Âu. Theo thông báo của công ty, Quasar 438B đạt điểm 43 trên Chỉ số trí tuệ phân tích nhân tạo, kết quả cao nhất so với bất kỳ mẫu máy châu Âu nào được đo theo tiêu chuẩn đó.

Sự ra mắt này đánh dấu một bước tiến quan trọng đối với công ty Tây Ban Nha, công ty đã xây dựng danh tiếng của mình về nén mô hình AI thay vì đào tạo các hệ thống quy mô biên giới. Quasar 438B là Máy tính đa vũ trụ mô hình lớn đầu tiên được phát hành và nó xuất hiện khi các chính phủ và công ty châu Âu thúc đẩy khả năng AI không phụ thuộc hoàn toàn vào các phòng thí nghiệm của Mỹ và Trung Quốc. Đối với độc giả theo dõi tin tức về AI của chúng tôi, bản phát hành cũng báo hiệu rằng cuộc đua thu hẹp khoảng cách với các mô hình tiên phong không còn giới hạn ở các đối thủ thông thường của Hoa Kỳ.

Quasar 438B thực sự ghi được điểm gì

Chỉ số Trí tuệ Phân tích Nhân tạo (phiên bản 4.1.1) kết hợp chín đánh giá, bao gồm GDPval-AA v2, tau3-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience và AA-LCR. Theo thông báo của công ty, điểm tổng hợp của Quasar 438B là 43, vượt lên trên Mistral Medium 3,5 ở mức 30, Nemotron 3 Ultra của NVIDIA ở mức 38 và Inkling ở mức 42.

Lĩnh vực rộng hơn vẫn thuộc về biên giới nước Mỹ: Claude Opus 5 dẫn đầu chỉ số ở vị trí 63. Multiverse Computing không khẳng định ngược lại. Thay vào đó, công ty coi Quasar 438B là lựa chọn mạnh nhất của Châu Âu, vượt trội so với các mẫu Châu Âu tương đương ở bảy trong số tám đánh giá Phân tích Nhân tạo đã chọn mà công ty nêu bật.

Tốc độ là đối số thứ hai

Điểm chuẩn thô chỉ bằng một nửa so với mức độ của Multiverse Computing. Công ty cho biết Quasar 438B trả về 500 token, bao gồm cả thời gian suy nghĩ, trong 15,3 giây. Trong số các mẫu được so sánh, chỉ có Nemotron 3.5 Lightning (9,4 giây), Gemini 3.5 Flash-Lite (10,8 giây) và Gemini 3.7 Flash (11,5 giây) là nhanh hơn và chỉ có Gemini 3.7 Flash là nhanh hơn và có nhiều khả năng hơn về chỉ số.

So sánh với Mistral Medium 3.5 diễn ra một chiều trên cả hai trục: Quasar đạt điểm cao hơn (43 so với 30) và trả lời nhanh hơn (15,3 giây so với 18,8 giây). Inkling, gần như ngang bằng với trí thông minh của Quasar ở tuổi 42, cần 48,3 giây cho cùng một phản hồi 500 mã thông báo, dài hơn gấp ba lần.

Lý luận theo ngữ cảnh dài mạnh mẽ

Một kết quả nổi bật so với công bố: trên AA-LCR, bài đánh giá kiểm tra khả năng trích xuất, kết nối và suy luận về thông tin trải dài trên các tài liệu dài, Quasar 438B đạt điểm 75,0. Theo số liệu của công ty, mức đó ngang bằng với Grok 4,6 (cao), trong khoảng cách với Claude Opus 5 ở mức 75,7 và trước Qwen3.8 2,4T A95B ở mức 75,3.

Việc xử lý ngữ cảnh dài rất quan trọng vì nghiên cứu doanh nghiệp, phân tích tài liệu và quy trình làm việc tác nhân được xây dựng dựa trên đó. Nếu một mô hình không thể lưu giữ và kết nối thông tin trong một tài liệu dài thì nó không thể cung cấp năng lượng cho các công cụ nhiều bước mà các công ty thực sự muốn triển khai. Đây là nơi Quasar đến gần nhất với nhóm biên giới.

Mã hóa đại lý vẫn còn khoảng trống

Kết quả yếu nhất trong thông báo là Terminal-Bench v2.1, khiến các tác nhân mã hóa hoạt động trong môi trường thiết bị đầu cuối thực. Quasar 438B đạt 69,3, dẫn đầu Mistral Medium 3,5 với 18,7 điểm và Nemotron 3 Ultra với 15,4 điểm, nhưng kém nhóm dẫn đầu là Claude Opus 5 với 89,1. Multiverse Computing thừa nhận đây là cuộc đánh giá có nhiều khoảng trống nhất và cho biết vòng công việc tiếp theo là nhằm vào nó.

Được xây dựng cho Đại lý doanh nghiệp

Quasar 438B được định vị là hình mẫu cho các tổ chức điều hành các đại lý phát triển phần mềm, phi công phụ kỹ thuật, hệ thống nghiên cứu và tự động hóa quy trình làm việc. Nó nằm trong lớp có hơn 400 tỷ tham số, xử lý tiếng Anh và tiếng Tây Ban Nha, đồng thời được thiết kế cho các tác vụ nhiều bước cần lập kế hoạch, sử dụng công cụ, thực thi mã và ngữ cảnh lớn mà không có độ trễ mà lớp thường mang.

Quyền truy cập chạy qua API CompactifAI của công ty, vì vậy các nhóm có thể thử nghiệm mô hình mà không cần thiết lập cơ sở hạ tầng của riêng họ. Multiverse Computing cho biết sắp có thêm nhiều bản cập nhật cho Quasar.

Ý nghĩa của cuộc đua AI ở Châu Âu

Việc phát hành diễn ra vào một thời điểm đặc biệt đối với AI châu Âu. Mistral, công ty tiêu chuẩn lâu đời của lục địa, đã phải đối mặt với các câu hỏi về hướng đi của mình, trong khi các phòng thí nghiệm của Hoa Kỳ đã củng cố vị trí dẫn đầu của họ về các tiêu chuẩn tổng hợp. Một mô hình châu Âu đứng đầu lĩnh vực châu Âu một cách hợp pháp về chỉ số độc lập mang lại cho các doanh nghiệp trên lục địa này một lựa chọn đáng tin cậy trong khu vực, đặc biệt là đối với việc triển khai song ngữ Anh-Tây Ban Nha.

Liệu Quasar 438B có giữ được vị trí đó hay không lại là chuyện khác. Bản thân công ty lưu ý rằng chỉ một phần nhỏ những người dẫn đầu chỉ số trả lời nhanh hơn và khoảng cách với Claude Opus 5 vẫn rộng 20 điểm. Nhưng công ty ưu tiên nén hiện đã cho thấy họ có thể cạnh tranh ở hạng nặng và các doanh nghiệp châu Âu cuối cùng cũng có được mô hình thị trường nội địa đáng để so sánh với tình trạng vỡ nợ ở Hoa Kỳ của họ.

Đi trước AI

Bối cảnh AI thay đổi theo giờ và các điểm chuẩn mà dường như không thể có được trong tháng 1 sẽ biến mất vào mùa hè. Đọc thêm tin tức AI trên AI Buzz Wire để theo dõi mọi lần phát hành mô hình, kết quả điểm chuẩn và sự thay đổi chính sách khi diễn ra.

Theo dõi những phát triển mới nhất của AI tại đây.