Perplexity đã ra mắt Máy tính di động, một phiên bản của nền tảng "Máy tính" đại lý chạy hoàn toàn trên phần cứng mà người dùng đã sở hữu - bắt đầu với siêu máy tính để bàn DGX Spark của Nvidia và các máy Linux được trang bị GPU RTX. Được phát triển với sự hợp tác chặt chẽ với Nvidia và được công bố vào ngày 25 tháng 8 năm 2026, đây là một trong những nỗ lực tích cực nhất nhằm chuyển khối lượng công việc của tác nhân AI nghiêm trọng ra khỏi đám mây và sang các thiết bị cục bộ.

Quảng cáo chiêu hàng rất đơn giản nhưng có hệ quả: mô hình, tệp của người dùng và bản thân công việc đều có thể ở lại trên máy. Công việc được hoàn thành cục bộ không tiêu tốn tín dụng thanh toán, mọi tác vụ đều bắt đầu trên thiết bị theo mặc định và hệ thống sẽ xin phép trước khi gửi bất kỳ bước riêng lẻ nào tới mô hình biên giới mạnh mẽ hơn trên đám mây. For more context on this story, see our ongoing AI trends.

Nate, phó chủ tịch kỹ thuật cơ sở hạ tầng và doanh nghiệp của Perplexity, cho biết trong cuộc họp báo hôm thứ Hai: “Về cơ bản, chúng tôi đã đưa giao diện người dùng giống hệt nhau vào một ứng dụng hoàn toàn cục bộ”. "Điều này kết hợp toàn bộ khả năng khai thác và suy luận của tác nhân cũng như mọi thứ cần thiết để hoạt động cục bộ."

Đối với Nvidia, công ty đã dành hai năm qua để bán cho thế giới các trung tâm dữ liệu AI trị giá hàng nghìn tỷ đô la, thông báo này mang một thông điệp tinh tế hơn: nhà sản xuất chip tin rằng AI địa phương đã vượt qua ngưỡng từ sự tò mò của người có sở thích đến công cụ thực tế. Nader, giám đốc công nghệ nhà phát triển của Nvidia cho biết: “AI cục bộ đã đạt đến điểm uốn. "Trong một thời gian dài, đó là những người có sở thích và những người đam mê... chạy các mô hình lượng tử hóa này được lượng tử hóa thành siêu nhỏ. Và mặc dù điều đó thật tuyệt nhưng nó không siêu thực tế. Nhưng tất cả đã thay đổi với rất nhiều mô hình nguồn mở mới này."

Ngăn xếp AI cục bộ đầy đủ trong một ứng dụng

Perplexity Computer, sản phẩm đám mây, sắp xếp các mô hình, tệp, công cụ và truy cập web để hoàn thành các nhiệm vụ công việc tri thức gồm nhiều bước — xem xét các thư mục tài liệu, phân tích dữ liệu và tạo báo cáo. Máy tính di động sao chép cục bộ điều đó, gói các mô hình cục bộ, khai thác tác nhân, công cụ suy luận, công cụ, trình kết nối ứng dụng và hộp cát bảo mật vào một ứng dụng duy nhất. Vấn đề đóng gói: với hầu hết các ngăn xếp AI cục bộ ngày nay, người dùng phải tự lắp ráp các phần đó - tải trọng lượng xuống, thiết lập máy chủ suy luận và nối các công cụ lại với nhau.

Trong bản giới thiệu báo chí, hệ thống đóng vai một nhà đầu tư bán lẻ đang xem xét thư mục gồm 1099 và các tài liệu đầu tư - loại tài liệu tài chính nhạy cảm mà nhiều người dùng ngần ngại tải lên dịch vụ đám mây. Chạy mô hình Qwen 27 tỷ tham số với mức sử dụng GPU tối đa trên DGX Spark, đại lý đã gắn cờ các trường hợp nhà đầu tư đang trả các khoản phí không cần thiết. Perplexity lưu ý rằng phần tử giao diện thường tính toán tín dụng trên đám mây "chỉ dừng ở mức 0".

Sản phẩm cũng mang tính lai chứ không phải kín. Bản demo thứ hai đã phân tích cục bộ một CSV dữ liệu kênh người dùng, sau đó đẩy phân tích đã hoàn thành sang Slack bằng cách sử dụng hệ sinh thái trình kết nối của Perplexity. Hệ thống kết nối với Google Drive, Gmail và GitHub và có thể chuyển sang mô hình đám mây biên giới khi mô hình cục bộ đạt đến giới hạn.

Yêu cầu và tính sẵn có

Khi ra mắt, người dùng có thể chạy Qwen 3.8 27B hoặc PPLX 27B — một phiên bản Perplexity đã được đào tạo sau trên dây nịt riêng của mình — sắp ra mắt Nemotron 3.5 Lightning của Nvidia. Hệ thống sử dụng vLLM để lưu trữ suy luận bên dưới, với chế độ nâng cao dành cho người dùng muốn cắm điểm cuối của riêng họ. Bất kỳ GPU RTX nào có ít nhất 24GB VRAM, khoảng GeForce RTX 3090 hoặc mới hơn, sẽ vượt qua giới hạn này.

Máy tính di động hiện có sẵn cho những người đăng ký Pro, Max, Enterprise Pro và Enterprise Max trên Linux, sau đó sẽ hỗ trợ Windows vào tháng 9.

Đồng thiết kế mô hình và dây nịt

Cùng với việc ra mắt, Perplexity đã xuất bản một bài nghiên cứu lập luận rằng các tác nhân cục bộ hiệu quả đòi hỏi phải thiết kế mô hình và khai thác tác nhân — giàn giáo của các lời nhắc, công cụ và logic điều phối — phải được thiết kế cùng nhau. Các dây nịt có mục đích chung giả định các mô hình biên giới có thể tiếp thu các bối cảnh rộng lớn và điều hướng các bề mặt công cụ rộng lớn; các mô hình địa phương nhỏ phải tuân theo những nhu cầu đó. Sự bối rối nhận thấy rằng mặc dù Qwen 3.8 27B quảng cáo cửa sổ ngữ cảnh 260.000 mã thông báo, nhưng nó bắt đầu gặp khó khăn khi vượt quá 100.000 mã thông báo.

Câu trả lời của công ty là một cách khai thác tối thiểu có chủ ý: lời nhắc hệ thống ngắn gọn, một bộ công cụ cốt lõi nhỏ và các khả năng tải và dỡ tải dưới dạng "kỹ năng" theo yêu cầu. Nó đã chuyển đổi các trình kết nối phổ biến như Gmail và GitHub từ máy chủ MCP ngốn mã thông báo thành các công cụ dòng lệnh nhỏ gọn, thêm móc tự xác minh và thực thi hộp cát cấp hệ điều hành luôn bật — nếu hộp cát không khả dụng, khai thác sẽ tự vô hiệu hóa thay vì chạy các công cụ không được bảo vệ.

Các kết quả điểm chuẩn Báo cáo Perplexity rất ấn tượng, mặc dù chúng đến từ những đánh giá của chính công ty. Trên Băng ghế công việc tri thức địa phương nội bộ của mình - 53 nhiệm vụ bao gồm nghiên cứu sâu, phân tích tài chính và tạo tài liệu mà Perplexity dự định chuyển sang nguồn mở - Máy tính chạy Qwen 3,8 27B trên DGX Spark đạt 82,6%, so với 77,6% đối với khai thác Pi nguồn mở và 74,0% đối với Hermes chạy mô hình tương tự. PPLX 27B sau đào tạo của Perplexity đã đẩy điểm số lên 85,4%. Trên DuyệtComp, một điểm chuẩn nghiên cứu web, Máy tính đạt độ chính xác 66,7% so với 50,2% đối với Pi và 43,9% đối với Hermes, đồng thời sử dụng ít thời gian treo tường hơn 51% và ít mã thông báo hơn 70% so với Pi.

Đại lý thúc đẩy kinh tế mã thông báo địa phương

Logic chiến lược trở nên rõ ràng trong cách khối lượng công việc AI đã thay đổi. Cuộc trò chuyện diễn ra sôi nổi - một câu hỏi, một câu trả lời, đã xong. Đại lý chạy hàng giờ. Nader nói: “Với các đại lý, bạn muốn các đại lý này luôn hoạt động nếu có thể… Những gì chúng tôi đang thấy là nhu cầu vô độ về mã thông báo và đó là điều khiến AI địa phương trở nên tuyệt vời”. "Bạn không được đo bằng mã thông báo. Bạn không trả tiền cho mã thông báo."

Nền tảng kết hợp giữa có thể là kết quả thú vị nhất về mặt thương mại. Trên Terminal Bench 2.1, một tiêu chuẩn mã hóa đầy thách thức, mô hình Qwen hoàn toàn cục bộ đạt 59,6% với chi phí cận biên về cơ bản bằng 0. Việc để nó chuyển lên "cố vấn" Claude Opus 5 trên đám mây đã nâng điểm số lên 73,0% với mức ước tính là 0,415 USD cho mỗi nhiệm vụ, trong khi chỉ chạy mô hình biên giới đã đạt được 82,4% ở mức 0,65 USD cho mỗi nhiệm vụ. Việc nâng cấp đã thu hồi khoảng 3/5 khoảng cách so với hiệu suất biên giới với khoảng 2/3 chi phí - và người dùng quyết định thời điểm thực hiện giao dịch. Trước bất kỳ cuộc gọi cố vấn nào, bộ khai thác sẽ chạy trình phân loại PII trong bối cảnh gửi đi và hiển thị cho người dùng chính xác những gì sẽ rời khỏi thiết bị; mô hình từ xa chỉ trả về hướng dẫn văn bản và không bao giờ chạm vào các tệp hoặc công cụ cục bộ.

Nvidia cũng nhấn mạnh rằng phần cứng có quy mô vượt ra ngoài một hộp duy nhất: kết nối hai DGX Sparks qua bộ nhớ dùng chung chạy các mô hình mở cấp biên giới như phiên bản mới nhất của DeepSeek, bốn chiếc có thể chạy GLM 5.2 hoặc Nemotron Ultra và Nader cho biết anh "thậm chí đã thấy tám Spark được kết nối."

Sự ra mắt này mở rộng mối quan hệ hợp tác đã được xây dựng trong hơn một năm, sau khi Nvidia và Perplexity công bố sự hợp tác AI có chủ quyền dành cho các nhà xuất bản và viễn thông châu Âu vào tháng 6 năm 2025. Đối với các nhà phát triển đang cân nhắc một chồng Ollama tự làm, các khai thác mở và suy luận tự lưu trữ, Máy tính xách tay đặt cược rằng trải nghiệm giống như một thiết bị — mô hình, bộ khai thác và hộp cát được đồng thiết kế — là điều cuối cùng khiến AI đại lý địa phương trở thành xu hướng chủ đạo.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →