欧洲人工智能公司MultiverseComputing推出了大型推理模型Quasar 438B,该公司称该模型是欧洲构建的最智能的人工智能模型。根据该公司的公告,Quasar 438B 在人工智能分析指数上得分为 43,是在该基准测试中所有欧洲型号中得分最高的。

此次发布标志着这家西班牙公司迈出的重要一步,该公司凭借人工智能模型压缩而不是训练前沿规模的系统而享有盛誉。 Quasar 438B 是 MultiverseComputing 发布的第一个大型模型,它的出现正值欧洲政府和公司推动不完全依赖美国和中国实验室的人工智能能力之际。对于关注我们人工智能新闻报道的读者来说,这一消息还表明,缩小与前沿模型差距的竞赛不再局限于通常的美国竞争者。

Quasar 438B 实际得分是多少

人工智能分析指数(版本4.1.1)结合了九项评估,包括GDPval-AA v2、tau3-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience和AA-LCR。根据该公司的公告,Quasar 438B 的综合得分为 43 分,领先于 Mistral Medium 3.5(30 分)、NVIDIA 的 Nemotron 3 Ultra(38 分)和 Inkling(42 分)。

更广泛的领域仍然属于美国前沿:Claude Opus 5 在该指数中领先,为 63。MultiverseComputing 并没有提出其他要求。相反,该公司将 Quasar 438B 视为最强的欧洲选择,在其强调的八项选定的人工分析评估中,有 7 项的表现优于欧洲同类模型。

速度是第二个参数

原始基准测试分数只是 MultiverseComputing 宣传的一半。该公司表示,Quasar 438B 在 15.3 秒内返回 500 个代币(包括思考时间)。在对比的型号中,只有 Nemotron 3.5 Lightning(9.4 秒)、Gemini 3.5 Flash-Lite(10.8 秒)和 Gemini 3.7 Flash(11.5 秒)速度更快,并且只有 Gemini 3.7 Flash 的速度更快、性能更强。

与 Mistral Medium 3.5 的比较在两个轴上都以一种方式进行:Quasar 得分更高(43 对 30)并且回答速度更快(15.3 秒对 18.8 秒)。 Inkling 的智力几乎与 Quasar 42 的智力相当,但同样的 500 个令牌响应需要 48.3 秒,是其三倍多。

强大的长上下文推理

公告中的一个结果非常引人注目:在 AA-LCR(测试长文档中传播的信息提取、连接和推理能力的评估)上,Quasar 438B 得分为 75.0。根据该公司的数据,这与 Grok 4.6(高)持平,与 Claude Opus 5 的 75.7 相差不远,并且领先于 Qwen3.8 2.4T A95B 的 75.3。

长上下文处理很重要,因为企业研究、文档分析和代理工作流程都是建立在它之上的。如果模型无法保存和连接长文档中的信息,则它无法为公司实际想要部署的多步骤工具提供支持。这是类星体最接近前沿群的地方。

代理编码仍有发展空间

公告中最弱的结果是 Terminal-Bench v2.1,它使编码代理可以在真实的终端环境中工作。 Quasar 438B 得分为 69.3,领先 Mistral Medium 3.5 18.7 分,领先 Nemotron 3 Ultra 15.4 分,但落后于 Claude Opus 5 领先的前沿组(89.1)。多元宇宙计算承认这是最具发展空间的评估,并表示下一轮工作就是针对它。

专为企业代理打造

Quasar 438B 被定位为运行软件开发代理、技术副驾驶、研究系统和工作流程自动化的组织的模型。它位于超过 4000 亿个参数的类中,处理英语和西班牙语,专为需要规划、工具使用、代码执行和大上下文的多步骤任务而设计,而没有类通常带来的延迟。

Access 通过该公司的 CompactifAI API 运行,因此团队无需建立自己的基础设施即可测试模型。多重宇宙计算表示,Quasar 的更多更新即将推出。

这对欧洲人工智能竞赛意味着什么

此次发布恰逢欧洲人工智能的特殊时刻。米斯特拉尔长期以来一直是非洲大陆的旗手,但其方向面临着质疑,而美国实验室则巩固了在综合基准方面的领先地位。在独立指数上名列前茅的欧洲模式为欧洲大陆的企业提供了可靠的区域选择,特别是对于英语-西班牙语双语部署而言。

Quasar 438B 是否保持这一位置则是另一回事。该公司本身指出,只有一小部分指数领先者的回答速度更快,与 Claude Opus 5 的差距仍然有 20 个百分点。但这家压缩优先的公司现在已经表明它可以在重量级级别中竞争,欧洲企业终于有了一个值得以美国违约为基准的国内市场模式。

保持人工智能领先地位

人工智能领域的格局每时每刻都在发生变化,一月份看似无懈可击的基准领先优势到了夏天就消失了。 在 AI Buzz Wire 上阅读更多人工智能新闻 跟踪每个模型发布、基准测试结果和政策转变。

在这里关注最新的人工智能发展