Perplexity ha lanciato Portable Computer, una versione della sua piattaforma "Computer" che funziona interamente su hardware già posseduto dagli utenti, a partire dal supercomputer desktop DGX Spark di Nvidia e dalle macchine Linux dotate di GPU RTX. Sviluppato in stretta collaborazione con Nvidia e annunciato il 25 agosto 2026, è uno dei tentativi più aggressivi finora di spostare gravi carichi di lavoro degli agenti IA dal cloud ai dispositivi locali.
La proposta è semplice ma consequenziale: il modello, i file dell'utente e il lavoro stesso possono rimanere tutti sulla macchina. Il lavoro completato localmente non consuma crediti di fatturazione, ogni attività viene avviata sul dispositivo per impostazione predefinita e il sistema chiede l'autorizzazione prima di inviare qualsiasi singolo passaggio a un modello di frontiera più potente nel cloud. Per maggiori informazioni su questa storia, consulta la nostra aggiornamenti sull'intelligenza artificiale.
"Fondamentalmente abbiamo portato la stessa identica interfaccia utente su un'app completamente locale", ha affermato Nate, vicepresidente dell'ingegneria per le infrastrutture e le imprese di Perplexity, durante una conferenza stampa lunedì. "Questo incorpora l'intero cablaggio e l'inferenza dell'agente e tutto il necessario per lavorare localmente."
Per Nvidia, che ha trascorso gli ultimi due anni vendendo al mondo data center IA da trilioni di dollari, l’annuncio porta un messaggio più sottile: il produttore di chip ritiene che l’IA locale abbia varcato la soglia dalla curiosità hobbistica allo strumento pratico. "L'intelligenza artificiale locale ha raggiunto un punto di svolta", ha affermato Nader, direttore della tecnologia per gli sviluppatori di Nvidia. "Per molto tempo, sono stati hobbisti e appassionati... a far funzionare questi modelli quantizzati per renderli super piccoli. E anche se è bello, non è super pratico. Ma tutto è cambiato con molti di questi nuovi modelli open source."
Uno stack completo di IA locale in un'unica app
Perplexity Computer, il prodotto cloud, orchestra modelli, file, strumenti e accesso Web per completare attività di lavoro basato sulla conoscenza in più fasi: revisione di cartelle di documenti, analisi di dati e produzione di report. Portable Computer lo replica localmente, raggruppando i modelli locali, il cablaggio degli agenti, il motore di inferenza, gli strumenti, i connettori delle app e una sandbox di sicurezza in un'unica applicazione. Il raggruppamento è importante: con la maggior parte degli stack IA locali oggi, gli utenti devono assemblare questi pezzi da soli, scaricando i pesi, installando un server di inferenza e collegando insieme gli strumenti.
In una demo per la stampa, il sistema ha interpretato un investitore al dettaglio che esaminava una cartella di 1099 e documenti di investimento, il tipo di materiale finanziario sensibile che molti utenti esiterebbero a caricare su un servizio cloud. Eseguendo un modello Qwen da 27 miliardi di parametri al pieno utilizzo della GPU su un DGX Spark, l'agente ha segnalato i casi in cui l'investitore pagava commissioni non necessarie. L'elemento dell'interfaccia che normalmente conta i crediti cloud, ha osservato Perplexity, "è semplicemente parcheggiato a zero".
Il prodotto è anche ibrido anziché ermetico. Una seconda demo ha analizzato localmente un CSV dei dati della canalizzazione degli utenti, quindi ha inviato l'analisi completata a Slack utilizzando l'ecosistema di connettori di Perplexity. Il sistema si connette a Google Drive, Gmail e GitHub e può passare a un modello cloud di frontiera quando il modello locale raggiunge i suoi limiti.
Requisiti e disponibilità
Al momento del lancio, gli utenti possono eseguire Qwen 3.8 27B o PPLX 27B - una versione che Perplexity ha post-addestrato sulla propria imbracatura - con Nemotron 3.5 Lightning di Nvidia in arrivo. Il sistema utilizza vLLM per ospitare l'inferenza sottostante, con una modalità avanzata per gli utenti che desiderano collegare il proprio endpoint. Qualsiasi GPU RTX con almeno 24 GB di VRAM, all'incirca una GeForce RTX 3090 o successiva, supera il livello.
Portable Computer è ora disponibile per gli abbonati Pro, Max, Enterprise Pro ed Enterprise Max su Linux, con il supporto per Windows che arriverà a settembre.
Co-progettazione del modello e dell'imbracatura
Accanto al lancio, Perplexity ha pubblicato un documento di ricerca in cui sostiene che gli agenti locali efficaci richiedono che il modello e il cablaggio dell’agente – l’impalcatura di suggerimenti, strumenti e logica di orchestrazione – siano progettati insieme. Le imbracature per uso generale presuppongono modelli di frontiera in grado di assorbire contesti enormi e navigare su superfici tentacolari di strumenti; i piccoli modelli locali cedono a queste richieste. Perplexity ha scoperto che sebbene Qwen 3.8 27B pubblicizzi una finestra di contesto da 260.000 token, inizia a faticare oltre i 100.000 token.
La risposta dell'azienda è un'implementazione volutamente minima: un breve messaggio di sistema, un piccolo insieme di strumenti fondamentali e funzionalità che vengono caricate e scaricate come "competenze" su richiesta. Ha convertito connettori popolari come Gmail e GitHub da server MCP affamati di token in strumenti compatti da riga di comando, ha aggiunto hook di autoverifica e ha applicato il sandboxing sempre attivo a livello di sistema operativo: se il sandbox non è disponibile, il cablaggio si disabilita anziché eseguire strumenti non protetti.
I risultati dei benchmark I resoconti delle perplessità colpiscono, nonostante provengano da valutazioni interne dell'azienda. Nel suo Local Knowledge Work Bench interno - 53 attività che spaziano dalla ricerca approfondita, all'analisi finanziaria e alla creazione di documenti, che Perplexity prevede di rendere open source - il computer che esegue Qwen 3.8 27B su un DGX Spark ha ottenuto l'82,6%, contro il 77,6% per il sistema Pi open source e il 74,0% per Hermes che esegue lo stesso modello. Il PPLX 27B post-addestrato di Perplexity ha spinto il punteggio all'85,4%. Su SfogliaComp, un benchmark di ricerca web, Computer ha raggiunto una precisione del 66,7% contro il 50,2% di Pi e il 43,9% di Hermes, utilizzando il 51% in meno di wall time e il 70% in meno di token rispetto a Pi.
L'economia dei token guida gli agenti locali
La logica strategica diventa chiara nel modo in cui sono cambiati i carichi di lavoro dell’IA. La chat era frenetica: una domanda, una risposta, fatta. Gli agenti lavorano per ore. "Con gli agenti, vuoi che siano sempre attivi se puoi... Quello che stiamo vedendo è una domanda insaziabile di token, e questo è qualcosa che rende l'IA locale così eccezionale", ha detto Nader. "Non sei stato misurato dal gettone. Non stavi pagando per il gettone."
La via di mezzo ibrida potrebbe essere il risultato commercialmente più interessante. Su Terminal Bench 2.1, un benchmark di codifica impegnativo, il modello Qwen completamente locale ha ottenuto il 59,6% a un costo marginale sostanzialmente pari a zero. Lasciarlo passare a un "consulente" Claude Opus 5 nel cloud ha aumentato il punteggio al 73,0% con una stima di 0,415 dollari per attività, mentre l'esecuzione del solo modello di frontiera ha ottenuto l'82,4% con 0,65 dollari per attività. L’escalation ha recuperato circa tre quinti del divario rispetto alle prestazioni di frontiera a circa due terzi del costo – e l’utente decide quando vale la pena effettuare l’operazione. Prima di qualsiasi chiamata all'advisor, il cablaggio esegue un classificatore PII sul contesto in uscita e mostra all'utente esattamente cosa lascerebbe il dispositivo; il modello remoto restituisce solo la guida testuale e non tocca mai file o strumenti locali.
Nvidia ha anche sottolineato che l'hardware va oltre un singolo dispositivo: collegando due DGX Spark tramite memoria condivisa si eseguono modelli aperti di frontiera come l'ultimo di DeepSeek, quattro possono eseguire GLM 5.2 o Nemotron Ultra, e Nader ha affermato di aver "visto anche otto Spark connettersi".
Il lancio estende una partnership che è stata costruita per più di un anno, dopo che Nvidia e Perplexity hanno annunciato una collaborazione sovrana sull'intelligenza artificiale per gli editori e le telecomunicazioni europei nel giugno 2025. Per gli sviluppatori che valutano una serie fai-da-te di Ollama, cablaggi aperti e inferenza self-hosted, la scommessa di Portable Computer è che un'esperienza simile a un elettrodomestico - modello co-progettato, cablaggio e sandbox - è ciò che finalmente rende mainstream l'intelligenza artificiale degli agenti locali.
---
Rimani Aggiornato sull'IALe ultime notizie, analisi e scoperte sull'intelligenza artificiale — tutto in un posto.
Leggi altre notizie sull'IA →