Perplexity har lanserat Portable Computer, en version av dess agentiska "Computer"-plattform som körs helt på maskinvaruanvändare som redan äger - till att börja med Nvidias DGX Spark stationära superdator och Linux-maskiner utrustade med RTX GPU:er. Utvecklat i nära samarbete med Nvidia och tillkännagav den 25 augusti 2026, är det ett av de mest aggressiva försöken hittills att flytta seriösa AI-agentarbetsbelastningar från molnet och till lokala enheter.
Pitch är enkel men konsekvent: modellen, användarens filer och själva arbetet kan alla stanna på maskinen. Arbete som slutförts lokalt förbrukar inga faktureringskrediter, varje uppgift startar på enheten som standard och systemet ber om tillåtelse innan det skickar ett individuellt steg till en kraftfullare frontiermodell i molnet. For more context on this story, see our ongoing artificial intelligence updates.
"Vi har i princip tagit med exakt samma användargränssnitt till en helt lokal app," sa Nate, Perplexitys vice vd för teknik för infrastruktur och företag, under en pressträff på måndagen. "Detta inkluderar hela agentens sele och slutledning och allt som behövs för att utföra arbete lokalt."
För Nvidia, som har tillbringat de senaste två åren med att sälja världen på biljoner dollar AI-datacenter, har tillkännagivandet ett mer subtilt budskap: chiptillverkaren tror att lokal AI har passerat en tröskel från hobby-nyfikenhet till praktiskt verktyg. "Lokal AI nådde en vändpunkt", säger Nader, Nvidias chef för utvecklarteknologi. "Under den längsta tiden var det hobbyister och entusiaster... att köra dessa kvantiserade modeller kvantifierade för att vara supersmå. Och även om det är coolt, är det inte superpraktiskt. Men allt det förändrades med många av dessa nya modeller med öppen källkod."
En fullständig lokal AI-stack i en app
Perplexity Computer, molnprodukten, orkestrerar modeller, filer, verktyg och webbåtkomst för att slutföra kunskapsarbete i flera steg – granska mappar med dokument, analysera data och producera rapporter. Bärbar dator replikerar det lokalt och kombinerar de lokala modellerna, agentkabeln, slutledningsmotorn, verktyg, appanslutningar och en säkerhetssandlåda i en enda applikation. Kombinationen spelar roll: med de flesta lokala AI-stackar idag måste användare montera delarna själva – ladda ner vikter, ställa upp en slutledningsserver och koppla ihop verktyg.
I en pressdemo spelade systemet en detaljinvesterare som granskade en mapp med 1099:or och investeringsdokument — den typ av känsligt finansiellt material som många användare skulle tveka att ladda upp till en molntjänst. Genom att köra en Qwen-modell med 27 miljarder parametrar vid full GPU-användning på en DGX Spark, flaggade agenten fall där investeraren betalade onödiga avgifter. Gränssnittselementet som normalt motsvarar molnkrediter, noterade Perplexity, "är bara parkerat på noll."
Produkten är också hybrid snarare än hermetisk. En andra demo analyserade en CSV av användartrattdata lokalt och skickade sedan den färdiga analysen till Slack med hjälp av Perplexitys anslutningsekosystem. Systemet ansluter till Google Drive, Gmail och GitHub och kan eskalera till en frontier molnmodell när den lokala modellen når sina gränser.
Krav och tillgänglighet
Vid lanseringen kan användare köra Qwen 3.8 27B eller PPLX 27B - en version som Perplexity har eftertränat på sin egen sele - med Nvidias Nemotron 3.5 Lightning som kommer snart. Systemet använder vLLM för att vara värd för slutledning under, med ett avancerat läge för användare som vill koppla in sin egen slutpunkt. Varje RTX GPU med minst 24 GB VRAM, ungefär en GeForce RTX 3090 eller nyare, rensar ribban.
Bärbar dator är tillgänglig nu för Pro-, Max-, Enterprise Pro- och Enterprise Max-prenumeranter på Linux, med Windows-stöd i september.
Samdesign av modellen och selen
Parallellt med lanseringen publicerade Perplexity ett forskningsdokument som argumenterade för att effektiva lokala agenter kräver att modellen och agentselen - byggnadsställningarna med uppmaningar, verktyg och orkestreringslogik - utformas tillsammans. Allmänna selar förutsätter gränsmodeller som kan absorbera enorma sammanhang och navigera vid vidsträckta verktygsytor; små lokala modeller spänns under dessa krav. Förvirring fann att även om Qwen 3.8 27B annonserar ett sammanhangsfönster på 260 000 token, börjar det kämpa mer än 100 000 tokens.
Företagets svar är en medvetet minimal sele: en kortfattad systemuppmaning, en liten uppsättning kärnverktyg och funktioner som laddar och lossar som "färdigheter" på begäran. Den konverterade populära anslutningar som Gmail och GitHub från tokenhungriga MCP-servrar till kompakta kommandoradsverktyg, lade till självverifieringskrokar och framtvingade alltid-på OS-nivå sandlådor - om sandlådan inte är tillgänglig, inaktiverar selen sig själv istället för att köra verktyg oskyddade.
Benchmarkresultaten Perplexity-rapporterna är slående, även om de kommer från företagets egna utvärderingar. På sin interna Local Knowledge Work Bench – 53 uppgifter som spänner över djup forskning, finansiell analys och dokumentskapande, som Perplexity planerar att öppna källkod – fick en dator som kör Qwen 3.8 27B på en DGX Spark 82,6 %, mot 77,6 % för Pi-selen med öppen källkod och 74,0 % för Hermes som kör den identiska. Perplexitys eftertränade PPLX 27B höjde poängen till 85,4 %. På BrowseComp, ett benchmark för webbforskning, fick Computer 66,7 % noggrannhet jämfört med 50,2 % för Pi och 43,9 % för Hermes, samtidigt som den använde 51 % mindre väggtid och 70 % färre tokens än Pi.
The Token Economics Driving Agents Local
Den strategiska logiken blir tydlig i hur AI-arbetsbelastningen har förändrats. Chatten var sprucken - en fråga, ett svar, klart. Agenter kör i timmar. "Med agenter vill du att dessa agenter alltid är på om du kan... Det vi ser är en omättlig efterfrågan på tokens, och det är något som gör lokal AI så bra", sa Nader. "Du mättes inte av poletten. Du betalade inte för poletten."
Hybridmedelvägen kan vara det mest kommersiellt intressanta resultatet. På Terminal Bench 2.1, ett utmanande riktmärke för kodning, fick den helt lokala Qwen-modellen 59,6 % till i princip noll marginalkostnad. Att låta det eskalera till en Claude Opus 5-"rådgivare" i molnet höjde poängen till 73,0 % till uppskattningsvis 0,415 USD per uppgift, medan enbart körning av frontiermodellen fick 82,4 % till 0,65 USD per uppgift. Eskalering återställde ungefär tre femtedelar av gapet till gränsprestanda till ungefär två tredjedelar av kostnaden - och användaren bestämmer när handeln är värd att göra. Innan ett rådgivaresamtal körs en PII-klassificerare över det utgående sammanhanget och visar användaren exakt vad som skulle lämna enheten; fjärrmodellen returnerar endast textvägledning och rör aldrig lokala filer eller verktyg.
Nvidia betonade också att hårdvaran skalar bortom en enda box: att ansluta två DGX Sparks över delat minne kör gränsklassiga öppna modeller som DeepSeeks senaste, fyra kan köra GLM 5.2 eller Nemotron Ultra, och Nader sa att han "till och med har sett åtta Sparks kopplas ihop."
Lanseringen förlänger ett partnerskap som har byggts upp i mer än ett år, efter att Nvidia och Perplexity tillkännagav ett suveränt AI-samarbete för europeiska utgivare och telekom i juni 2025. För utvecklare som väger en gör-det-själv-stack av Ollama, öppna selar och självvärderade slutledningar, är Portable Computers insats att en apparatliknande modellupplevelse är det som gör lokal, AI-design och en slutlig agent. mainstream.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →