Perplexity a lancé Portable Computer, une version de sa plate-forme « informatique » agentique qui fonctionne entièrement sur le matériel que les utilisateurs possèdent déjà – à commencer par le superordinateur de bureau DGX Spark de Nvidia et les machines Linux équipées de GPU RTX. Développé en étroit partenariat avec Nvidia et annoncé le 25 août 2026, il s’agit de l’une des tentatives les plus agressives à ce jour pour déplacer les charges de travail importantes des agents d’IA du cloud vers des appareils locaux.

Le pitch est simple mais conséquent : le modèle, les fichiers de l'utilisateur et l'œuvre elle-même peuvent rester sur la machine. Le travail effectué localement ne consomme aucun crédit de facturation, chaque tâche démarre sur l'appareil par défaut et le système demande la permission avant d'envoyer une étape individuelle à un modèle frontière plus puissant dans le cloud. Pour plus de contexte sur cette histoire, consultez notre couverture de l'industrie de l'IA.

"Nous avons essentiellement apporté exactement la même interface utilisateur à une application entièrement locale", a déclaré Nate, vice-président de l'ingénierie pour les infrastructures et les entreprises de Perplexity, lors d'un point de presse lundi. "Cela intègre l'intégralité du harnais et de l'inférence des agents ainsi que tout ce qui est nécessaire pour travailler localement."

Pour Nvidia, qui a passé les deux dernières années à vendre des centres de données d'IA valant des milliers de milliards de dollars, l'annonce véhicule un message plus subtil : le fabricant de puces estime que l'IA locale a franchi le seuil de la curiosité amateur pour devenir un outil pratique. "L'IA locale a atteint un point d'inflexion", a déclaré Nader, directeur de la technologie des développeurs chez Nvidia. "Pendant très longtemps, c'étaient des amateurs et des passionnés... qui utilisaient ces modèles quantifiés pour les rendre super petits. Et même si c'est cool, ce n'est pas très pratique. Mais tout cela a changé avec beaucoup de ces nouveaux modèles open source."

Une pile d'IA locale complète dans une seule application

Perplexity Computer, le produit cloud, orchestre les modèles, les fichiers, les outils et l'accès au Web pour effectuer des tâches de travail de connaissances en plusieurs étapes : examiner des dossiers de documents, analyser des données et produire des rapports. L'ordinateur portable réplique cela localement, en regroupant les modèles locaux, le faisceau d'agents, le moteur d'inférence, les outils, les connecteurs d'application et un bac à sable de sécurité dans une seule application. Le regroupement est important : avec la plupart des piles d'IA locales d'aujourd'hui, les utilisateurs doivent assembler ces éléments eux-mêmes : en téléchargeant des poids, en mettant en place un serveur d'inférence et en câblant les outils ensemble.

Dans une démonstration de presse, le système incarnait un investisseur de détail examinant un dossier de 1099 et de documents d'investissement – ​​le genre de documents financiers sensibles que de nombreux utilisateurs hésiteraient à télécharger sur un service cloud. En exécutant un modèle Qwen de 27 milliards de paramètres avec une utilisation complète du GPU sur un DGX Spark, l'agent a signalé les cas dans lesquels l'investisseur payait des frais inutiles. L'élément d'interface qui compte normalement les crédits cloud, a noté Perplexity, "est simplement garé à zéro".

Le produit est également hybride plutôt qu’hermétique. Une deuxième démo a analysé localement un CSV de données d'entonnoir d'utilisateur, puis a transmis l'analyse terminée à Slack à l'aide de l'écosystème de connecteurs de Perplexity. Le système se connecte à Google Drive, Gmail et GitHub et peut évoluer vers un modèle cloud frontalier lorsque le modèle local atteint ses limites.

Exigences et disponibilité

Au lancement, les utilisateurs peuvent exécuter Qwen 3.8 27B ou PPLX 27B – une version que Perplexity a post-formée sur son propre harnais – avec le Nemotron 3.5 Lightning de Nvidia bientôt disponible. Le système utilise vLLM pour héberger l'inférence en dessous, avec un mode avancé pour les utilisateurs qui souhaitent connecter leur propre point de terminaison. Tout GPU RTX avec au moins 24 Go de VRAM, à peu près une GeForce RTX 3090 ou plus récente, franchit la barre.

L'ordinateur portable est désormais disponible pour les abonnés Pro, Max, Enterprise Pro et Enterprise Max sous Linux, la prise en charge de Windows suivra en septembre.

Co-conception du modèle et du harnais

Parallèlement au lancement, Perplexity a publié un document de recherche affirmant que les agents locaux efficaces nécessitent que le modèle et l'ensemble des agents (l'échafaudage d'invites, d'outils et de logique d'orchestration) soient conçus ensemble. Les harnais à usage général supposent des modèles frontières capables d’absorber d’énormes contextes et de naviguer sur des surfaces d’outils tentaculaires ; les petits modèles locaux cèdent à ces exigences. Perplexity a constaté que, bien que Qwen 3.8 27B annonce une fenêtre contextuelle de 260 000 jetons, il commence à avoir du mal au-delà de 100 000 jetons.

La réponse de l'entreprise est un harnais volontairement minimal : une invite système succincte, un petit ensemble d'outils de base et des capacités qui se chargent et se déchargent en tant que « compétences » à la demande. Il a converti les connecteurs populaires tels que Gmail et GitHub des serveurs MCP gourmands en jetons en outils de ligne de commande compacts, ajouté des hooks d'auto-vérification et appliqué un sandboxing toujours actif au niveau du système d'exploitation - si le bac à sable n'est pas disponible, le harnais se désactive plutôt que d'exécuter des outils non protégés.

Les résultats du benchmark Les rapports Perplexity sont frappants, même s'ils proviennent des propres évaluations de l'entreprise. Sur son banc de travail interne sur les connaissances locales – 53 tâches couvrant la recherche approfondie, l'analyse financière et la création de documents, que Perplexity prévoit de rendre open source – l'ordinateur exécutant Qwen 3.8 27B sur un DGX Spark a obtenu un score de 82,6 %, contre 77,6 % pour le harnais Pi open source et 74,0 % pour Hermes exécutant le modèle identique. Le PPLX 27B post-entraîné de Perplexity a poussé le score à 85,4 %. Sur BrowseComp, une référence de recherche sur le Web, Computer a atteint une précision de 66,7 % contre 50,2 % pour Pi et 43,9 % pour Hermes, tout en utilisant 51 % de temps de mur en moins et 70 % de jetons en moins que Pi.

L'économie des jetons qui stimule les agents locaux

La logique stratégique apparaît clairement dans la façon dont les charges de travail de l’IA ont changé. Le chat était intense – une question, une réponse, c'était fait. Les agents courent pendant des heures. "Avec les agents, vous voulez que ces agents soient toujours actifs si vous le pouvez... Ce que nous constatons, c'est une demande insatiable de jetons, et c'est quelque chose qui rend l'IA locale si géniale", a déclaré Nader. "Vous n'étiez pas mesuré par le jeton. Vous ne payiez pas pour le jeton."

Le juste milieu hybride pourrait être le résultat le plus intéressant sur le plan commercial. Sur Terminal Bench 2.1, une référence de codage exigeante, le modèle Qwen entièrement local a obtenu un score de 59,6 % avec un coût marginal pratiquement nul. Le fait de le laisser passer à un « conseiller » Claude Opus 5 dans le cloud a augmenté le score à 73,0 % à un prix estimé à 0,415 $ par tâche, tandis que l'exécution du modèle frontière seul a obtenu un score de 82,4 % à 0,65 $ par tâche. L'escalade a récupéré environ les trois cinquièmes de l'écart par rapport aux performances de pointe pour environ les deux tiers du coût – et l'utilisateur décide quand l'échange vaut la peine d'être effectué. Avant tout appel du conseiller, le harnais exécute un classificateur PII sur le contexte sortant et montre à l'utilisateur exactement ce qui quitterait l'appareil ; le modèle distant renvoie uniquement un guidage textuel et ne touche jamais aux fichiers ou outils locaux.

Nvidia a également souligné que le matériel évoluait au-delà d'un seul boîtier : la connexion de deux DGX Spark sur une mémoire partagée exécute des modèles ouverts de classe frontière comme le dernier de DeepSeek, quatre peuvent exécuter GLM 5.2 ou Nemotron Ultra, et Nader a déclaré qu'il avait "même vu huit Sparks se connecter".

Ce lancement prolonge un partenariat qui s'est construit depuis plus d'un an, après que Nvidia et Perplexity ont annoncé une collaboration souveraine en matière d'IA pour les éditeurs et les télécommunications européens en juin 2025. Pour les développeurs pesant une pile DIY d'Ollama, des harnais ouverts et une inférence auto-hébergée, le pari de Portable Computer est qu'une expérience de type appareil - modèle, harnais et bac à sable co-conçus - est ce qui fait finalement de l'IA agentique locale un courant dominant.

---

Restez à la Pointe de l'IA

Les dernières actualités, analyses et percées en IA — au même endroit.

Lire plus d'actualités IA →