Perplexity는 Nvidia의 DGX Spark 데스크톱 슈퍼컴퓨터와 RTX GPU가 장착된 Linux 시스템을 시작으로 사용자가 이미 소유한 하드웨어에서 완전히 실행되는 에이전트 "컴퓨터" 플랫폼 버전인 휴대용 컴퓨터를 출시했습니다. Nvidia와의 긴밀한 파트너십을 통해 개발되어 2026년 8월 25일에 발표된 이 제품은 심각한 AI 에이전트 워크로드를 클라우드에서 로컬 장치로 이동하려는 가장 공격적인 시도 중 하나입니다.

주제는 간단하지만 중요합니다. 모델, 사용자 파일, 작업 자체가 모두 컴퓨터에 유지될 수 있습니다. 로컬에서 완료된 작업은 청구 크레딧을 소비하지 않으며 모든 작업은 기본적으로 장치에서 시작되며 시스템은 개별 단계를 클라우드의 보다 강력한 프론티어 모델로 보내기 전에 허가를 요청합니다. 이 이야기에 대한 자세한 내용은 AI 뉴스를 참조하세요.

Perplexity의 인프라 및 기업 엔지니어링 담당 부사장인 Nate는 월요일 언론 브리핑에서 "우리는 기본적으로 완전히 동일한 UI를 완전히 로컬 앱에 가져왔습니다."라고 말했습니다. "이에는 에이전트 하네스와 추론 전체, 그리고 로컬에서 작업하는 데 필요한 모든 것이 통합되어 있습니다."

지난 2년 동안 전 세계에 1조 달러 규모의 AI 데이터 센터를 판매해 온 Nvidia의 경우, 이번 발표는 더 미묘한 메시지를 전달합니다. 칩 제조업체는 로컬 AI가 취미 생활의 호기심에서 실용적인 도구로 한계점을 넘었다고 믿습니다. Nvidia의 개발자 기술 담당 이사인 Nader는 "로컬 AI가 변곡점에 도달했습니다."라고 말했습니다. "오랫동안 취미생활을 즐기는 사람들과 매니아들이었습니다. 이러한 양자화된 모델을 초소형으로 양자화하여 실행하는 것은 멋지지만 그다지 실용적이지는 않습니다. 그러나 많은 새로운 오픈 소스 모델로 인해 모든 것이 바뀌었습니다."

하나의 앱에 전체 로컬 AI 스택

클라우드 제품인 Perplexity Computer는 모델, 파일, 도구 및 웹 액세스를 조정하여 문서 폴더 검토, 데이터 분석 및 보고서 생성 등 다단계 지식 작업 작업을 완료합니다. 휴대용 컴퓨터는 이를 로컬로 복제하여 로컬 모델, 에이전트 하네스, 추론 엔진, 도구, 앱 커넥터 및 보안 샌드박스를 단일 애플리케이션으로 묶습니다. 번들링이 중요합니다. 오늘날 대부분의 로컬 AI 스택에서는 사용자가 가중치를 다운로드하고, 추론 서버를 설치하고, 도구를 연결하는 등 이러한 부분을 직접 조립해야 합니다.

언론 데모에서 시스템은 1099 폴더와 투자 문서를 검토하는 소매 투자자 역할을 맡았습니다. 이는 많은 사용자가 클라우드 서비스에 업로드하기를 주저하는 민감한 금융 자료입니다. 에이전트는 DGX Spark에서 GPU를 최대로 활용하여 270억 매개변수 Qwen 모델을 실행하면서 투자자가 불필요한 수수료를 지불하는 사례를 표시했습니다. Perplexity는 일반적으로 클라우드 크레딧을 계산하는 인터페이스 요소가 "그냥 0으로 고정되어 있습니다"라고 지적했습니다.

제품도 밀폐형이 아닌 하이브리드형입니다. 두 번째 데모에서는 사용자 퍼널 데이터의 CSV를 로컬에서 분석한 다음 Perplexity의 커넥터 에코시스템을 사용하여 완성된 분석을 Slack으로 푸시했습니다. 시스템은 Google Drive, Gmail 및 GitHub에 연결되며 로컬 모델이 한계에 도달하면 프론티어 클라우드 모델로 에스컬레이션할 수 있습니다.

요구 사항 및 가용성

출시 시 사용자는 Perplexity가 자체 하네스에서 사후 훈련한 버전인 Qwen 3.8 27B 또는 PPLX 27B를 실행할 수 있으며 Nvidia의 Nemotron 3.5 Lightning도 곧 출시될 예정입니다. 시스템은 vLLM을 사용하여 자체 엔드포인트에 연결하려는 사용자를 위한 고급 모드와 함께 추론을 호스팅합니다. 24GB 이상의 VRAM을 갖춘 모든 RTX GPU(대략 GeForce RTX 3090 이상)는 기준을 충족합니다.

휴대용 컴퓨터는 현재 Linux의 Pro, Max, Enterprise Pro 및 Enterprise Max 가입자에게 제공되며 Windows는 9월에 지원됩니다.

모델과 하네스 공동 설계

출시와 함께 Perplexity는 효과적인 로컬 에이전트를 위해서는 모델과 에이전트 하네스(프롬프트, 도구 및 오케스트레이션 로직의 기반)가 함께 설계되어야 한다고 주장하는 연구 논문을 발표했습니다. 범용 하네스는 엄청난 컨텍스트를 흡수하고 확장된 도구 표면을 탐색할 수 있는 프론티어 모델을 가정합니다. 소규모 지역 모델은 이러한 요구에 부응합니다. Perplexity는 Qwen 3.8 27B가 260,000개의 토큰 컨텍스트 창을 광고하지만 100,000개의 토큰을 넘어서는 데 어려움을 겪기 시작한다는 사실을 발견했습니다.

회사의 대답은 간결한 시스템 프롬프트, 소규모 핵심 도구 세트, 주문형 "기술"로 로드 및 언로드되는 기능 등 의도적으로 최소한의 하네스입니다. 토큰이 부족한 MCP 서버에서 Gmail 및 GitHub와 같은 널리 사용되는 커넥터를 소형 명령줄 도구로 변환하고, 자체 확인 후크를 추가하고, 상시 OS 수준 샌드박싱을 시행했습니다. 샌드박스를 사용할 수 없는 경우 도구를 보호되지 않은 상태로 실행하는 대신 하네스가 자체적으로 비활성화됩니다.

벤치마크 결과 Perplexity 보고서는 회사 자체 평가에서 나온 것이지만 놀랍습니다. Perplexity가 오픈 소스로 계획하고 있는 심층 연구, 재무 분석 및 문서 생성을 포괄하는 53개 작업에 대한 내부 로컬 지식 작업 벤치에서 DGX Spark에서 Qwen 3.8 27B를 실행하는 컴퓨터는 82.6%를 기록했으며, 오픈 소스 Pi 하니스는 77.6%, 동일한 모델을 실행하는 Hermes는 74.0%를 기록했습니다. Perplexity의 사후 훈련된 PPLX 27B는 점수를 85.4%로 높였습니다. 웹 연구 벤치마크인 BrowseComp에서 컴퓨터는 Pi의 경우 50.2%, Hermes의 경우 43.9%에 비해 66.7%의 정확도를 기록했으며, Pi보다 벽 시간은 51%, 토큰 사용량은 70% 적었습니다.

토큰 경제를 주도하는 현지 에이전트

AI 워크로드가 어떻게 변화했는지에 대한 전략적 논리가 명확해집니다. 채팅은 분주했습니다. 질문과 답변이 모두 끝났습니다. 에이전트는 몇 시간 동안 실행됩니다. "에이전트를 사용하면 가능하다면 이러한 에이전트가 항상 켜져 있기를 원합니다... 우리가 보고 있는 것은 토큰에 대한 만족할 수 없는 수요이며 이것이 로컬 AI를 매우 훌륭하게 만드는 것입니다."라고 Nader는 말했습니다. "당신은 토큰으로 측정되지 않았습니다. 당신은 토큰 비용을 지불하지 않았습니다."

하이브리드 중간지대는 상업적으로 가장 흥미로운 결과일 수 있습니다. 까다로운 코딩 벤치마크인 Terminal Bench 2.1에서 완전 로컬 Qwen 모델은 본질적으로 한계 비용이 0인 상태에서 59.6%의 점수를 받았습니다. 클라우드의 Claude Opus 5 "고문"에게 에스컬레이션하면 작업당 약 0.415달러로 점수가 73.0%로 올랐고, 프론티어 모델만 실행하면 작업당 0.65달러로 82.4%의 점수를 얻었습니다. 에스컬레이션은 약 2/3의 비용으로 프론티어 성능 격차의 약 3/5를 복구했으며 사용자는 거래할 가치가 있는 시기를 결정합니다. 조언자 호출 전에 하네스는 발신 컨텍스트에 대해 PII 분류자를 실행하고 사용자에게 장치에서 나가는 내용을 정확하게 보여줍니다. 원격 모델은 텍스트 지침만 반환하고 로컬 파일이나 도구는 건드리지 않습니다.

Nvidia는 또한 하드웨어가 단일 상자 이상으로 확장된다는 점을 강조했습니다. 공유 메모리를 통해 두 개의 DGX Spark를 연결하면 DeepSeek의 최신과 같은 최전방급 개방형 모델이 실행되고, 네 개는 GLM 5.2 또는 Nemotron Ultra를 실행할 수 있으며 Nader는 "8개의 Spark가 연결되는 것을 본 적도 있습니다"라고 말했습니다.

이번 출시는 Nvidia와 Perplexity가 2025년 6월 유럽 출판사와 통신업체를 위한 주권 AI 협력을 발표한 이후 1년 넘게 구축해온 파트너십을 확장합니다. Ollama, 개방형 하네스 및 자체 호스팅 추론의 DIY 스택을 평가하는 개발자를 위해 Portable Computer는 공동 설계 모델, 하네스 및 샌드박스와 같은 가전제품과 같은 경험이 마침내 로컬 에이전트 AI를 주류로 만드는 것이라고 확신합니다.

---

AI 최신 소식

최신 AI 뉴스, 분석 및 혁신을 한 곳에서 확인하세요.

AI 뉴스 더 보기 →