Perplexity 推出了便携式计算机,这是其代理“计算机”平台的一个版本,完全在用户已有的硬件上运行——首先是 Nvidia 的 DGX Spark 桌面超级计算机和配备 RTX GPU 的 Linux 机器。它是与 Nvidia 密切合作开发的,并于 2026 年 8 月 25 日宣布,是将重要的 AI 代理工作负载从云端转移到本地设备上的最积极的尝试之一。
宣传很简单但很重要:模型、用户的文件和工作本身都可以保留在机器上。本地完成的工作不消耗任何计费积分,默认情况下每个任务都会在设备上启动,并且系统在将任何单独步骤发送到云中更强大的前沿模型之前都会请求许可。 更多相关背景,请参阅我们的人工智能资讯。
Perplexity 基础设施和企业工程副总裁 Nate 在周一的新闻发布会上表示:“我们基本上为完全本地化的应用程序带来了完全相同的 UI。” “这包含了整个代理的利用和推理以及在本地工作所需的一切。”
对于过去两年向全球销售价值数万亿美元的人工智能数据中心的英伟达来说,这一公告传达了一个更微妙的信息:这家芯片制造商认为,本地人工智能已经跨越了从业余爱好者的好奇心到实用工具的门槛。英伟达开发技术总监纳德表示:“本地人工智能达到了拐点。” “在很长一段时间里,都是业余爱好者和爱好者......运行这些量化的模型,量化为超微小。虽然这很酷,但它不是超级实用。但随着许多新的开源模型的出现,这一切都改变了。”
一个应用程序中的完整本地 AI 堆栈
Perplexity Computer 是一种云产品,可协调模型、文件、工具和 Web 访问来完成多步骤的知识工作任务 - 审查文档文件夹、分析数据和生成报告。便携式计算机在本地进行复制,将本地模型、代理工具、推理引擎、工具、应用程序连接器和安全沙箱捆绑到单个应用程序中。捆绑很重要:对于当今大多数本地人工智能堆栈,用户必须自己组装这些部件——下载权重、建立推理服务器并将工具连接在一起。
在新闻演示中,系统扮演一名散户投资者,正在查看一个包含 1099 和投资文件的文件夹——许多用户会犹豫是否将这种敏感的财务材料上传到云服务。该代理在 DGX Spark 上以满 GPU 利用率运行 270 亿参数的 Qwen 模型,标记了投资者支付不必要费用的情况。 Perplexity 指出,通常计算云积分的界面元素“只是停留在零”。
该产品也是混合型而非封闭型。第二个演示在本地分析了用户渠道数据的 CSV,然后使用 Perplexity 的连接器生态系统将完成的分析推送到 Slack。该系统连接到Google Drive、Gmail和GitHub,当本地模型达到极限时可以升级到前沿云模型。
要求和可用性
发布时,用户可以运行 Qwen 3.8 27B 或 PPLX 27B(Perplexity 已在自己的工具上进行后训练的版本),Nvidia 的 Nemotron 3.5 Lightning 即将推出。该系统使用 vLLM 来托管底层推理,并为想要插入自己端点的用户提供高级模式。任何具有至少 24GB VRAM 的 RTX GPU(大约是 GeForce RTX 3090 或更高版本)都可以满足这一要求。
Portable Computer 现已面向 Linux 上的 Pro、Max、Enterprise Pro 和 Enterprise Max 订户推出,Windows 支持将于 9 月份提供。
共同设计模型和线束
在发布的同时,Perplexity 发表了一篇研究论文,认为有效的本地代理需要将模型和代理工具(提示、工具和编排逻辑的支架)一起设计。通用工具采用前沿模型,可以吸收大量上下文并导航庞大的工具表面;小型本地模型在这些要求下屈服了。 Perplexity 发现,尽管 Qwen 3.8 27B 宣传了 260,000 个令牌的上下文窗口,但它开始在超过 100,000 个令牌时陷入困境。
该公司的答案是故意采用最小化的工具:简洁的系统提示、一小组核心工具以及作为按需“技能”加载和卸载的功能。它将 Gmail 和 GitHub 等流行的连接器从需要令牌的 MCP 服务器转换为紧凑的命令行工具,添加了自我验证挂钩,并强制执行始终在线的操作系统级沙箱 - 如果沙箱不可用,则该工具会自行禁用,而不是运行不受保护的工具。
Perplexity 报告的基准结果令人震惊,尽管它们来自该公司自己的评估。在其内部本地知识工作台(Perplexity 计划开源的涵盖深度研究、财务分析和文档创建的 53 项任务)上,在 DGX Spark 上运行 Qwen 3.8 27B 的计算机得分为 82.6%,而开源 Pi 工具的得分为 77.6%,运行相同模型的 Hermes 得分为 74.0%。 Perplexity 训练后的 PPLX 27B 将分数推至 85.4%。在网络研究基准 BrowseComp 上,Computer 的准确率达到 66.7%,而 Pi 为 50.2%,Hermes 为 43.9%,而使用的挂机时间比 Pi 少 51%,令牌少 70%。
代币经济驱动本地代理
人工智能工作负载如何变化,战略逻辑变得清晰。聊天很突然——一个问题,一个答案,就完成了。代理运行数小时。 “对于代理,如果可以的话,你希望这些代理始终处于开启状态……我们看到的是对代币的无限需求,而这正是本地人工智能如此伟大的原因,”纳德说。 “你没有通过代币进行计量。你没有为代币付费。”
混合中间立场可能是商业上最有趣的结果。在 Terminal Bench 2.1(一项具有挑战性的编码基准)上,完全本地化的 Qwen 模型在边际成本基本为零的情况下得分为 59.6%。让它升级为云中的 Claude Opus 5“顾问”,将得分提高到 73.0%,每项任务的估计费用为 0.415 美元,而单独运行前沿模型的得分为 82.4%,每项任务的费用为 0.65 美元。升级以大约三分之二的成本弥补了与前沿性能的大约五分之三的差距——并且用户决定何时值得进行交易。在进行任何顾问呼叫之前,该工具会在传出上下文上运行 PII 分类器,并向用户准确显示将离开设备的内容;远程模型仅返回文本指导,从不触及本地文件或工具。
Nvidia 还强调,硬件规模超出了单个盒子的范围:通过共享内存连接两个 DGX Spark 运行前沿级开放模型,如 DeepSeek 的最新模型,四个可以运行 GLM 5.2 或 Nemotron Ultra,Nader 表示他“甚至看到八个 Spark 连接起来”。
此次发布延续了 Nvidia 和 Perplexity 于 2025 年 6 月宣布为欧洲出版商和电信公司开展主权人工智能合作之后已经建立了一年多的合作伙伴关系。对于权衡 Ollama、开放式线束和自托管推理的 DIY 堆栈的开发人员来说,Portable Computer 的赌注是类似设备的体验(共同设计的模型、线束和沙箱)最终使本地代理人工智能成为主流。
---
掌握AI最新动态获取最新的AI新闻、分析和突破——尽在一处。
阅读更多AI新闻 →