Searchlight Cyber​​ 的安全研究人员证明,OpenAI 的 GPT-5.6 编码模型可以发现 WordPress 中的严重远程代码执行漏洞,API 成本约为 25 美元,这一发现让人们越来越担心如何将前沿人工智能工具武器化,以仅占其黑市价值的一小部分来发现可利用的缺陷。

这项发表在 Searchlight Cyber​​ 网站上的研究表明,一名研究人员配备了 GPT-5.6 Sol Ultra 和故意易受攻击的 WordPress 代码库,能够识别从预身份验证访问一直到远程代码执行的一条链。这一结果成为一场关于大型语言模型的进攻性安全潜力的争论的中心,这个主题贯穿了最新的人工智能发展

50 万美元市场中 25 美元的发现

这项研究的主题是其赤裸裸的经济学。据 Searchlight Cyber​​ 称,漏洞利用经纪人是购买漏洞并将其转售给政府和私人买家的中间人,他们将为可靠的 WordPress 远程代码执行漏洞支付高达 50 万美元的费用。 WordPress 为大约 40% 的网站提供支持,这使得核心 RCE 错误变得异常有价值。

与该基准相比,研究人员在 GPT-5.6 API 调用上花费的大约 25 美元来发现该缺陷是引人注目的。这项工作不需要大型团队、专门的模糊测试基础设施或数周的手动审核。相反,它依赖于指导一个有能力的编码模型从第一原理推理 WordPress 的源代码。

研究人员发布了一个免费检查工具 wp2Shell.com,以便管理员可以确定他们的 WordPress 实例是否受到影响。他们表示,他们保留了完整的发布细节,以便让捍卫者有时间做出回应。

模型如何发现缺陷

这一发现的核心是 WordPress 的钩子系统,该机制为该平台提供了庞大的插件生态系统。挂钩的名称如“wp_enqueue_scripts”或“publish_post”,允许插件将自定义行为附加到 WordPress 生命周期的几乎每个阶段。它们分为执行副作用的操作和在数据通过时修改数据的过滤器。

这种灵活性也是一个庞大的攻击面。研究人员设定的任务是找到一条允许从未经身份验证的起点远程执行代码的链,成功的定义是能够从服务器的文件系统读取受保护的文件。

GPT-5.6 Sol Ultra 是 OpenAI 的以推理为中心的编码模型,它通过检查数据如何流经 WordPress 的钩子并进入潜在危险的操作来进行分析。该模型的优势不在于盲目搜索模式,而在于对组件之间的交互进行推理,随着最近以推理为重点的模型发布,这一功能得到了显着改进。

研究人员围绕一个包含易受攻击的 WordPress 副本的存储库进行了这项练习,该设置类似于“夺旗挑战”,其中成功意味着提取一个标志文件。但他们强调,底层漏洞类别是真实存在的,会影响运行 MySQL 的生产部署,MySQL 是大多数实时 WordPress 网站背后的数据库。

两用困境

这一发现的出现正值人工智能公司面临对其模型如何被滥用的严格审查。前沿模型越来越多地评估其协助网络攻击的能力,随着能力的提升,结果变得越来越令人不安。一个模型可以将发现关键漏洞的成本从数十万美元降低到几杯咖啡的价格,以具体的方式重塑威胁格局。

防御者认为,同样的功能可以加速防御工作,帮助安全团队在攻击者之前发现并修补漏洞。 Searchlight Cyber​​ 本身占据了这条线的两边,提供攻击面管理和暗网监控工具,同时发布攻击性研究。 wp2Shell 检查器体现了防御性案例:将发现结果转化为管理员可以立即采取行动的内容。

但这种不对称性很难被忽视。拥有 API 密钥的孤独研究人员现在可以获得曾经需要资金充足的团队才能获得的审计权力。随着发现漏洞的成本下降,负担转移到修补漏洞的速度和规模上。

这对 WordPress 及其他领域意味着什么

对于 WordPress 生态系统来说,这项研究提醒我们,该平台的钩子架构是其插件经济的基础,也是其最重要的弱点。鼓励网站运营商运行 wp2Shell 检查器,保持插件和核心更新,并限制未经身份验证的用户可以访问的内容。

更广泛地说,该实验是一场快速辩论中的一个数据点,这场辩论的主题是开放安全研究和进攻性人工智能能力的扩散之间的界限应该在哪里。随着编码模型的能力变得越来越强大,像这样的演示可能会变得更加普遍,而不是更少。

保持人工智能领先地位

人工智能和网络安全的交叉发展速度超出任何单个团队的追踪速度。如需报道进攻性 AI 研究、防御性工具以及随后的政策辩论,请关注 AI Buzz Wire 上的 AI 行业报道

阅读更多人工智能新闻 →