微软推出了 MAI-Cyber​​-1-Flash,这是其首款专为网络安全而构建的人工智能模型,标志着该公司在推动使用前沿人工智能来保护自己的软件及其客户的软件方面迈出了重要一步。该模型旨在识别隐藏在复杂代码库中的具有挑战性的漏洞,现已集成到微软更广泛的多代理安全平台中。

据SecurityWeek和微软官方博客称,MAI-Cyber​​-1-Flash已部署在该公司的多代理漏洞识别和修复工具MDASH内部。 MDASH 协调了 100 多个专门的 AI 代理,跨多个前沿和精炼的 AI 模型工作,并且已经用于发现 Microsoft 自家产品中的众多漏洞。新模型是企业人工智能工具如何重塑安全格局的最新例子——我们在突发人工智能新闻报道中一直密切跟踪这一趋势。

MAI-Cyber-1-Flash 的用途

该模型经过专门调整,可以发现其他人工智能系统容易遗漏的软件漏洞。 MAI-Cyber​​-1-Flash 并未尝试成为通用助手,而是针对一项狭窄但关键的任务进行了优化:分析复杂的源代码以检测可利用的缺陷。

微软将该架构解释为一种注重成本的路由系统。该公司在公告中写道:“MAI-Cyber​​-1-Flash 的设计目的是有效处理高达 90% 的所有任务,使 MDASH 能够使用我们车队中更大、最昂贵的模型(在本例中为 GPT-5.4)来处理真正需要它们的 10% 的异常艰巨的任务。”这种分层方法意味着常规漏洞扫描在更便宜的专用模型上运行,而只有最困难的情况才会升级到更强大和更昂贵的系统。

该公司补充说,与之前最好的 MDASH 配置(依赖于 GPT-5.4 与 5.4 mini 和 5.3 codex 相结合)相比,这种组合可节省 50% 的成本。微软表示:“这就是经过精心调整的多模型系统的力量,可以访问独特的丰富历史训练数据。”

基准性能

在使用 CyberGym 网络安全评估框架进行的测试中,MAI-Cyber-1-Flash、MDASH 和 GPT-5.4 的组合获得了约 96% 的分数,微软称这比 Anthropic 的 Mythos 5 高出约 12 分。根据该公司的内部基准测试,相同配置在漏洞发现方面也优于谷歌最近推出的 3.5 Flash Cyber 和 OpenAI 的 GPT-5.6 Sol。

值得注意的是,这些结果是微软自行报告的。网络安全人工智能基准的独立验证仍然有限,Cyber​​Gym 框架仍然是评估领域中相对较新的补充。随着 Google、OpenAI 和 Anthropic 各自的专业安全模型的成熟,它们的竞争模型很可能会缩小差距。

项目感知和公众预览

MAI-Cyber-1-Flash 通过 Project Perception 向客户提供,Project Perception 是一种代理安全产品,使组织能够为软件漏洞管理之外的安全工作流程部署自主 AI 代理。据微软称,Project Perception 将于 8 月 3 日进入公开预览版。

此次发布标志着该公司更广泛的战略转变。微软越来越多地构建自己的专业人工智能模型,而不是完全依赖合作伙伴 OpenAI 的通用模型——这是该公司一直在多个产品线中推行的成本降低战略。通过拥有特定于网络安全的模型,微软既可以降低推理成本,又可以根据企业安全团队的特定需求定制系统。

不断增长的人工智能安全市场

随着组织努力跟上每年发现的漏洞数量,网络安全人工智能市场正在迅速扩张。微软采取这一举措之际,人们对人工智能相关安全风险的认识不断提高,此前 Hugging Face 发生了一次违规事件,其中一个自主人工智能代理访问了内部数据管道并暴露了凭证。

该事件促使 Nvidia 成立了开放安全人工智能联盟,该联盟由 40 多家公司组成,专注于开发人工智能安全的开放标准。微软将 MAI-Cyber​​-1-Flash 和 Project Perception 定位为防御方面的贡献——使用 AI 代理不仅可以发现错误,而且可以在攻击者利用它们之前修复它们。

TechCrunch 和 Axios 报道称,微软设想未来人工智能代理可以自动修补生产系统中的漏洞。据 Axios 称,该公司的目标是让人工智能代理在黑客发现错误之前修复错误。

这对行业意味着什么

微软推出专用网络安全模型提高了更广泛的人工智能行业的竞争优势。如果事实证明专门的安全模型比通用漏洞检测系统更便宜、更有效,那么其他主要人工智能提供商可能会效仿,推出自己的特定领域产品。

对于企业客户而言,人工智能驱动的安全运营成本降低 50% 的承诺意义重大。安全团队一直是人工智能工具的最大采用者之一,但以持续漏洞扫描所需的规模运行前沿模型的成本一直是一个持续的障碍。一个经过精心调整的专业模型能够以很少的成本处理大多数任务,可以加速整个行业的采用。

现在的关键问题是,微软自我报告的基准测试是否经得起独立审查,以及来自 OpenAI、Google 和 Anthropic 的竞争模型是否可以与专门为单一任务构建的系统的性能相匹配。随着 Project Perception 于 8 月进入公开预览版,网络安全社区将首次了解 MAI-Cyber​​-1-Flash 是否符合 Microsoft 的说法。

保持人工智能安全发展的领先地位

随着网络安全 AI 领域的发展,阅读更多 AI 新闻

阅读更多人工智能新闻 →