Perplexity a lansat Portable Computer, o versiune a platformei sale agentice „Computer” care rulează în întregime pe hardware-ul deținut de utilizatorii deja – începând cu supercomputerul desktop Nvidia DGX Spark și mașinile Linux echipate cu GPU-uri RTX. Dezvoltat în parteneriat strâns cu Nvidia și anunțat pe 25 august 2026, este una dintre cele mai agresive încercări de până acum de a muta încărcături serioase de agenți AI de pe cloud și pe dispozitive locale.
Pitch-ul este simplu, dar cu consecințe: modelul, fișierele utilizatorului și munca în sine pot rămâne toate pe mașină. Lucrările efectuate la nivel local nu consumă credite de facturare, fiecare sarcină începe implicit pe dispozitiv, iar sistemul cere permisiunea înainte de a trimite orice pas individual către un model de frontieră mai puternic în cloud. For more context on this story, see our ongoing more AI stories.
„Practic, am adus exact aceeași interfață de utilizare într-o aplicație complet locală”, a declarat Nate, vicepreședintele de inginerie pentru infrastructură și întreprindere al Perplexity, în timpul unei conferințe de presă luni. „Acest lucru încorporează întregul cablaj și inferența agenților și tot ceea ce este necesar pentru a lucra la nivel local.”
Pentru Nvidia, care și-a petrecut ultimii doi ani vânzând lumea în centre de date AI de un trilion de dolari, anunțul poartă un mesaj mai subtil: producătorul de cipuri crede că AI local a depășit pragul de la curiozitatea hobbyist la instrument practic. „Intelligenția artificială locală a atins un punct de inflexiune”, a spus Nader, directorul de tehnologie pentru dezvoltatori Nvidia. „Pentru cea mai lungă perioadă de timp, au fost pasionați și entuziaști... care rulează aceste modele cuantificate cuantificate în jos pentru a fi super minuscule. Și, deși este mișto, nu este super practic. Dar toate acestea s-au schimbat cu multe dintre aceste noi modele open source.”
O stivă AI locală completă într-o singură aplicație
Perplexity Computer, produsul cloud, orchestrează modele, fișiere, instrumente și acces la web pentru a finaliza sarcini de lucru cu cunoștințe în mai mulți pași — revizuirea dosarelor de documente, analizarea datelor și producerea de rapoarte. Computer portabil replic acest lucru la nivel local, grupând modelele locale, cablajul agentului, motorul de inferență, instrumentele, conectorii pentru aplicații și un sandbox de securitate într-o singură aplicație. Gruparea contează: cu majoritatea stivelor de AI locale de astăzi, utilizatorii trebuie să asambleze ei înșiși acele piese - descărcarea greutăților, ridicarea unui server de inferență și conectarea instrumentelor împreună.
Într-o demonstrație de presă, sistemul a jucat rolul unui investitor de retail care examina un folder cu 1099 și documente de investiții - genul de material financiar sensibil pe care mulți utilizatori ar ezita să îl încarce într-un serviciu cloud. Rulând un model Qwen cu 27 de miliarde de parametri la utilizarea completă a GPU-ului pe un DGX Spark, agentul a semnalat cazurile în care investitorul plătea taxe inutile. Elementul de interfață care înregistrează în mod normal creditele cloud, a remarcat Perplexity, „este doar parcat la zero”.
Produsul este, de asemenea, mai degrabă hibrid decât ermetic. O a doua demonstrație a analizat un CSV de date ale canalului de utilizator la nivel local, apoi a împins analiza finală la Slack folosind ecosistemul conector al lui Perplexity. Sistemul se conectează la Google Drive, Gmail și GitHub și poate escalada la un model cloud de frontieră atunci când modelul local își atinge limitele.
Cerințe și disponibilitate
La lansare, utilizatorii pot rula Qwen 3.8 27B sau PPLX 27B - o versiune pe care Perplexity a postat-o pe propriul ham - cu Nemotron 3.5 Lightning de la Nvidia care va veni în curând. Sistemul folosește vLLM pentru a găzdui inferența dedesubt, cu un mod avansat pentru utilizatorii care doresc să-și conecteze propriul punct final. Orice GPU RTX cu cel puțin 24 GB de VRAM, aproximativ un GeForce RTX 3090 sau mai nou, eliberează bara.
Computer portabil este disponibil acum pentru abonații Pro, Max, Enterprise Pro și Enterprise Max pe Linux, urmând suport Windows în septembrie.
Co-proiectarea modelului și a hamului
Odată cu lansarea, Perplexity a publicat o lucrare de cercetare în care susținea că agenții locali eficienți necesită ca modelul și cablajul agentului - schela de prompturi, instrumente și logica de orchestrare - să fie proiectate împreună. Hamurile de uz general presupun modele de frontieră care pot absorbi contexte enorme și pot naviga pe suprafețele extinse de instrumente; micile modele locale cedează sub aceste cerințe. Perplexity a constatat că, deși Qwen 3.8 27B face publicitate unei ferestre de context de 260.000 de jetoane, începe să se lupte dincolo de 100.000 de jetoane.
Răspunsul companiei este un ham în mod deliberat minim: un prompt de sistem succint, un set mic de instrumente de bază și capabilități care se încarcă și se descarcă ca „competențe” la cerere. A convertit conectori populari, cum ar fi Gmail și GitHub, de la servere MCP avide de jetoane în instrumente compacte de linie de comandă, a adăugat cârlige de autoverificare și a impus sandboxing permanent la nivel de sistem de operare - dacă sandbox-ul nu este disponibil, cablajul se dezactivează singur, în loc să ruleze instrumentele neprotejate.
Rezultatele de referință Rapoartele Perplexity sunt izbitoare, deși provin din propriile evaluări ale companiei. Pe locul său intern de lucru Local Knowledge Work Bench — 53 de sarcini care acoperă cercetare profundă, analiză financiară și crearea de documente, pe care Perplexity intenționează să le deschidă — Computerul care rulează Qwen 3.8 27B pe un DGX Spark a obținut un scor de 82,6%, față de 77,6% pentru cablajul Pi open source și 74,0% pentru modelul identic Hermes. PPLX 27B post-antrenat al lui Perplexity a împins scorul la 85,4%. Pe BrowseComp, un etalon de cercetare web, Computer a atins o acuratețe de 66,7% față de 50,2% pentru Pi și 43,9% pentru Hermes, folosind în același timp cu 51% mai puțin timp de perete și cu 70% mai puține jetoane decât Pi.
The Token Economics Driving Agents Local
Logica strategică devine clară în modul în care s-au schimbat încărcăturile de lucru AI. Chatul a fost explodat - o întrebare, un răspuns, gata. Agenții rulează ore întregi. „Cu agenți, vrei ca acești agenți să fie mereu activi, dacă poți... Ceea ce vedem este o cerere nesățioasă de jetoane și asta este ceva care face AI local atât de mare”, a spus Nader. "Nu ai fost măsurat de jeton. Nu plăteai pentru jeton."
Calea de mijloc hibridă poate fi rezultatul cel mai interesant din punct de vedere comercial. Pe Terminal Bench 2.1, un etalon de codificare provocator, modelul Qwen complet local a obținut un scor de 59,6% la un cost marginal practic zero. Lăsându-l să escaladeze la un „consilier” Claude Opus 5 în cloud, a crescut scorul la 73,0% la o valoare estimată de 0,415 USD per sarcină, în timp ce rularea modelului de frontieră singur a obținut un scor de 82,4% la 0,65 USD per sarcină. Escalarea a recuperat aproximativ trei cincimi din diferența față de performanța de frontieră la aproximativ două treimi din cost - iar utilizatorul decide când merită tranzacția. Înainte de orice apel de consilier, cablajul rulează un clasificator PII peste contextul de ieșire și arată utilizatorului exact ce ar părăsi dispozitivul; modelul de la distanță returnează doar ghidarea text și nu atinge niciodată fișierele sau instrumentele locale.
Nvidia a subliniat, de asemenea, că hardware-ul se extinde dincolo de o singură cutie: conectarea a două DGX Spark pe o memorie partajată rulează modele deschise de clasă frontieră, cum ar fi cel mai recent DeepSeek, patru pot rula GLM 5.2 sau Nemotron Ultra, iar Nader a spus că „a văzut chiar și opt Spark-uri conectându-se”.
Lansarea extinde un parteneriat care se construiește de mai bine de un an, după ce Nvidia și Perplexity au anunțat o colaborare suverană AI pentru editorii europeni și telecomunicații în iunie 2025. Pentru dezvoltatorii care cântăresc un teanc DIY de Ollama, hamuri deschise și inferență auto-găzduită, pariul Portable Computer este că o experiență asemănătoare unui aparat electrocasnic - co-proiectare este o experiență finală, un agent co-proiectat și un model local. AI mainstream.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →