Perplexity は、NVIDIA の DGX Spark デスクトップ スーパーコンピューターや RTX GPU を搭載した Linux マシンをはじめ、ユーザーがすでに所有しているハードウェア上で完全に実行される、エージェント型「コンピューター」プラットフォームのバージョンであるポータブル コンピューターを立ち上げました。 Nvidia との緊密なパートナーシップで開発され、2026 年 8 月 25 日に発表されたこのサービスは、深刻な AI エージェントのワークロードをクラウドからローカル デバイスに移行するという、これまでで最も積極的な試みの 1 つです。

提案はシンプルですが結果的なものです。モデル、ユーザーのファイル、および作業自体はすべてマシン上に残すことができます。ローカルで完了した作業は請求クレジットを消費せず、すべてのタスクはデフォルトでデバイス上で開始され、システムは個々のステップをクラウド内のより強力なフロンティア モデルに送信する前に許可を求めます。 この件の詳細は、AIニュースをご覧ください。

「私たちは基本的にまったく同じ UI を完全なローカル アプリに導入しました」と Perplexity のインフラストラクチャおよびエンタープライズ向けエンジニアリング担当バイスプレジデントであるネイト氏は月曜日の記者会見で述べました。 「これには、エージェントの利用と推論、およびローカルでの作業に必要なすべてが組み込まれています。」

過去 2 年間、数兆ドル規模の AI データセンターを世界に販売してきた Nvidia にとって、この発表は、より微妙なメッセージを伝えています。チップメーカーは、ローカル AI が趣味的な好奇心から実用的なツールへと閾値を超えたと信じているのです。 Nvidia の開発者テクノロジー担当ディレクターの Nader 氏は、「ローカル AI は変曲点に達しました」と述べています。 「長い間、これらの量子化モデルを超小型に量子化して実行するのは愛好家や愛好家だけでした。そして、それは素晴らしいことですが、非常に実用的ではありません。しかし、これらの新しいオープンソース モデルの多くですべてが変わりました。」

1 つのアプリで完全なローカル AI スタックを実現

クラウド製品である Perplexity Computer は、モデル、ファイル、ツール、Web アクセスを調整して、ドキュメントのフォルダーの確認、データの分析、レポートの作成など、複数のステップから成るナレッジワーク タスクを完了します。ポータブル コンピューターはそれをローカルに複製し、ローカル モデル、エージェント ハーネス、推論エンジン、ツール、アプリ コネクタ、セキュリティ サンドボックスを 1 つのアプリケーションにバンドルします。バンドルは重要です。今日のほとんどのローカル AI スタックでは、ユーザーは重みをダウンロードし、推論サーバーを立ち上げ、ツールを相互に接続するなど、それらの部分を自分で組み立てる必要があります。

プレス向けのデモでは、このシステムは、1099 や投資書類のフォルダーをレビューする個人投資家を演じました。これらの書類は、多くのユーザーがクラウド サービスにアップロードすることを躊躇するような機密性の高い財務資料です。エージェントは、DGX Spark 上で GPU をフル活用して 270 億パラメータの Qwen モデルを実行し、投資家が不必要な手数料を支払っているケースにフラグを立てました。 Perplexity 氏は、通常はクラウド クレジットを集計するインターフェイス要素が「ゼロのままになっている」と指摘しました。

この製品は密閉型ではなくハイブリッド型でもあります。 2 番目のデモでは、ユーザー ファネル データの CSV をローカルで分析し、Perplexity のコネクタ エコシステムを使用して完成した分析を Slack にプッシュしました。このシステムは Google Drive、Gmail、GitHub に接続し、ローカル モデルが限界に達した場合にはフロンティア クラウド モデルにエスカレーションできます。

要件と可用性

発売時には、ユーザーは Qwen 3.8 27B または PPLX 27B (Perplexity が独自のハーネスで事後トレーニングしたバージョン) を実行でき、Nvidia の Nemotron 3.5 Lightning も間もなく登場します。システムは vLLM を使用して推論をホストし、独自のエンドポイントを接続したいユーザー向けの詳細モードを備えています。少なくとも 24 GB の VRAM を搭載した RTX GPU (およそ GeForce RTX 3090 以降) はこの基準をクリアします。

Portable Computer は現在、Linux 上の Pro、Max、Enterprise Pro、Enterprise Max サブスクライバー向けに提供されており、9 月には Windows もサポートされます。

モデルとハーネスの共同設計

Perplexity は、この発表と並行して、効果的なローカル エージェントにはモデルとエージェント ハーネス (プロンプト、ツール、オーケストレーション ロジックの足場) を一緒に設計する必要があると主張する研究論文を発表しました。汎用ハーネスは、膨大なコンテキストを吸収し、広大なツール表面をナビゲートできるフロンティア モデルを想定しています。小規模な地元モデルはこうした要求に屈します。 Perplexity は、Qwen 3.8 27B が 260,000 トークンのコンテキスト ウィンドウをアドバタイズしているにもかかわらず、100,000 トークンを超えると苦戦し始めることを発見しました。

同社の答えは、意図的に最小限のハーネス、つまり簡潔なシステム プロンプト、少数のコア ツール セット、オンデマンドの「スキル」としてロードおよびアンロードする機能です。 Gmail や GitHub などの一般的なコネクタを、トークンを大量に消費する MCP サーバーからコンパクトなコマンドライン ツールに変換し、自己検証フックを追加し、常時稼働の OS レベルのサンドボックスを強制しました。サンドボックスが利用できない場合は、保護されていないツールを実行するのではなく、ハーネス自体が無効になります。

Perplexity のレポートによるベンチマーク結果は、同社独自の評価に基づくものではありますが、驚くべきものです。社内のローカル ナレッジ ワーク ベンチ (Perplexity がオープンソース化を計画している、詳細な調査、財務分析、文書作成に及ぶ 53 のタスク) では、DGX Spark 上で Qwen 3.8 27B を実行しているコンピューターのスコアが 82.6% であったのに対し、オープンソースの Pi ハーネスでは 77.6%、同一モデルを実行している Hermes では 74.0% でした。 Perplexity のトレーニング後の PPLX 27B は、スコアを 85.4% まで押し上げました。ウェブ調査ベンチマークである BrowseComp では、Computer の精度は 66.7% でしたが、Pi では 50.2%、Hermes では 43.9% でしたが、使用するウォールタイムは Pi よりも 51% 少なく、トークンの使用量は 70% 少なくなりました。

トークンエコノミクスがローカルエージェントを推進

AI ワークロードがどのように変化したかを見ると、戦略的ロジックが明らかになります。チャットは活発で、質問があり、回答があり、完了しました。エージェントは何時間も実行されます。 「エージェントの場合、できればエージェントを常に稼働させておきたいものです...私たちが目にしているのは、トークンに対する飽くなき需要であり、それがローカル AI を非常に優れたものにしているのです」と Nader 氏は言いました。 「トークンによって計測されませんでした。トークンの料金を支払っていませんでした。」

ハイブリッドの中間点は、商業的に最も興味深い結果となるかもしれません。難しいコーディング ベンチマークである Terminal Bench 2.1 では、完全にローカルな Qwen モデルは限界費用が実質的にゼロで 59.6% のスコアを獲得しました。クラウド内の Claude Opus 5 の「アドバイザー」にエスカレーションすると、タスクあたり推定 0.415 ドルでスコアが 73.0% に上昇しましたが、フロンティア モデルのみを実行するとタスクあたり 0.65 ドルで 82.4% のスコアとなりました。エスカレーションにより、約 3 分の 2 のコストでフロンティアのパフォーマンスとのギャップの約 5 分の 3 が回復しました。いつ取引を行う価値があるかはユーザーが決定します。アドバイザを呼び出す前に、ハーネスは発信コンテキストに対して PII 分類子を実行し、デバイスから送信されるものを正確にユーザーに表示します。リモート モデルはテキスト ガイダンスのみを返し、ローカル ファイルやツールには一切触れません。

Nvidia はまた、ハードウェアが 1 つのボックスを超えて拡張できることも強調しました。共有メモリを介して 2 つの DGX Spark を接続すると、DeepSeek の最新のようなフロンティアクラスのオープン モデルが実行され、4 つで GLM 5.2 または Nemotron Ultra を実行でき、Nader 氏は「8 台の Spark が接続されているのを見たことさえある」と述べました。

この発表は、Nvidia と Perplexity が 2025 年 6 月にヨーロッパのパブリッシャーと通信会社向けに主権 AI 提携を発表して以来、1 年以上にわたって構築してきたパートナーシップを拡大するものです。Ollama、オープン ハーネス、セルフホスト型推論の DIY スタックを比較検討する開発者にとって、Portable Computer の賭けは、アプライアンスのようなエクスペリエンス (共同設計されたモデル、ハーネス、サンドボックス) が最終的にローカル エージェント AI を主流にするものであるということです。

---

AIの最新情報をお届け

AIの最新ニュース、分析、ブレイクスルーを一箇所で。

AIニュースをもっと読む →