Perplexity کامپیوتر قابل حمل را راه‌اندازی کرده است، نسخه‌ای از پلتفرم عامل خود "رایانه" که به طور کامل بر روی سخت افزاری که کاربران از قبل در اختیار دارند اجرا می‌شود – از ابررایانه‌های رومیزی DGX Spark انویدیا و ماشین‌های لینوکس مجهز به پردازنده‌های گرافیکی RTX شروع می‌شود. این برنامه که با همکاری نزدیک با انویدیا توسعه یافته و در 25 آگوست 2026 اعلام شد، یکی از تهاجمی‌ترین تلاش‌هایی است که تاکنون برای انتقال حجم کار جدی عامل هوش مصنوعی از فضای ابری و روی دستگاه‌های محلی انجام شده است.

گام ساده اما پیامد است: مدل، فایل‌های کاربر و خود کار همگی می‌توانند روی دستگاه باقی بمانند. کاری که به صورت محلی انجام می‌شود، هیچ اعتبار صورت‌حساب مصرف نمی‌کند، هر کار به‌طور پیش‌فرض روی دستگاه شروع می‌شود، و سیستم قبل از ارسال هر مرحله جداگانه به یک مدل مرزی قدرتمندتر در ابر، اجازه می‌گیرد. For more context on this story, see our ongoing AI industry coverage.

نیت، معاون مهندسی زیرساخت و سازمانی Perplexity، در یک نشست مطبوعاتی در روز دوشنبه گفت: «ما اساساً دقیقاً همان رابط کاربری را به یک برنامه کاملاً محلی آورده‌ایم. "این شامل کل مهار عامل و استنتاج و همه چیزهایی است که برای انجام کار به صورت محلی لازم است."

برای انویدیا، که دو سال گذشته را صرف فروش دنیا بر روی مراکز داده هوش مصنوعی تریلیون دلاری کرده است، این اعلامیه پیام ظریف تری را به همراه دارد: سازنده تراشه معتقد است هوش مصنوعی محلی از آستانه کنجکاوی سرگرمی به ابزار عملی عبور کرده است. نادر، مدیر فناوری توسعه دهندگان انویدیا گفت: هوش مصنوعی محلی به نقطه عطف رسیده است. "برای طولانی ترین زمان، علاقه مندان و علاقه مندان بودند... اجرای این مدل های کوانتیزه شده به صورت کوانتیزه شده بسیار کوچک است. و با وجود اینکه جالب است، فوق العاده عملی نیست. اما همه چیز با بسیاری از این مدل های منبع باز جدید تغییر کرد."

پشته کامل هوش مصنوعی محلی در یک برنامه

Perplexity Computer، محصول ابری، مدل‌ها، فایل‌ها، ابزارها و دسترسی به وب را برای تکمیل وظایف چند مرحله‌ای دانش - بررسی پوشه‌های اسناد، تجزیه و تحلیل داده‌ها، و تولید گزارش‌ها هماهنگ می‌کند. رایانه قابل حمل آن را به صورت محلی تکرار می‌کند، مدل‌های محلی، مهار عامل، موتور استنتاج، ابزارها، رابط‌های برنامه و یک جعبه ایمنی امنیتی را در یک برنامه واحد ترکیب می‌کند. بسته‌بندی مهم است: امروزه با اکثر پشته‌های هوش مصنوعی محلی، کاربران باید خودشان آن قطعات را جمع‌آوری کنند - بارگیری وزن‌ها، ایستادن یک سرور استنتاج و ابزارهای سیم‌کشی با هم.

در یک نسخه نمایشی مطبوعاتی، سیستم نقش سرمایه‌گذار خرده‌فروشی را بازی کرد که در حال بررسی پوشه‌ای از 1099s و اسناد سرمایه‌گذاری بود – نوعی از مطالب مالی حساس که بسیاری از کاربران در آپلود آن در سرویس ابری تردید دارند. با اجرای یک مدل Qwen با 27 میلیارد پارامتر با استفاده کامل از GPU بر روی DGX Spark، این نماینده مواردی را که سرمایه‌گذار هزینه‌های غیرضروری پرداخت می‌کرد، علامت‌گذاری کرد. Perplexity اشاره کرد که عنصر رابط که معمولاً اعتبارات ابری را محاسبه می کند، "فقط روی صفر پارک شده است."

این محصول نیز به جای هرمتیک، هیبریدی است. نسخه ی نمایشی دوم CSV داده های قیف کاربر را به صورت محلی تجزیه و تحلیل کرد، سپس تجزیه و تحلیل نهایی را با استفاده از اکوسیستم رابط Perplexity به Slack منتقل کرد. این سیستم به Google Drive، Gmail و GitHub متصل می‌شود و زمانی که مدل محلی به محدودیت‌های خود برسد، می‌تواند به یک مدل ابر مرزی تبدیل شود.

الزامات و در دسترس بودن

در زمان راه‌اندازی، کاربران می‌توانند Qwen 3.8 27B یا PPLX 27B را اجرا کنند - نسخه‌ای که Perplexity بر روی مهار خود آموزش داده است - با Nemotron 3.5 Lightning انویدیا به زودی. این سیستم از vLLM برای میزبانی استنتاج در زیر استفاده می‌کند، با یک حالت پیشرفته برای کاربرانی که می‌خواهند نقطه پایانی خود را وصل کنند. هر پردازنده گرافیکی RTX با حداقل 24 گیگابایت VRAM، تقریباً GeForce RTX 3090 یا جدیدتر، نوار را پاک می کند.

رایانه قابل حمل اکنون برای مشترکین Pro، Max، Enterprise Pro و Enterprise Max در لینوکس در دسترس است و ویندوز در ماه سپتامبر پشتیبانی می کند.

طراحی مشترک مدل و هارنس

در کنار پرتاب، Perplexity یک مقاله تحقیقاتی منتشر کرد که در آن استدلال می‌کرد که عوامل محلی مؤثر نیاز دارند که مدل و مهار عامل - داربست اعلان‌ها، ابزارها و منطق ارکستراسیون - با هم طراحی شوند. مهارهای همه منظوره مدل‌های مرزی را در نظر می‌گیرند که می‌توانند زمینه‌های عظیم را جذب کنند و سطوح ابزار گسترده را هدایت کنند. مدل های کوچک محلی تحت این خواسته ها دست و پنجه نرم می کنند. Perplexity دریافت که اگرچه Qwen 3.8 27B یک پنجره زمینه 260000 توکن را تبلیغ می کند، اما بیش از 100000 توکن شروع به مبارزه می کند.

پاسخ این شرکت یک مهار عمداً حداقلی است: یک سیستم مختصر، مجموعه کوچکی از ابزارهای اصلی، و قابلیت‌هایی که به عنوان «مهارت‌های» درخواستی بارگیری و تخلیه می‌شوند. این کانکتورهای محبوب مانند Gmail و GitHub را از سرورهای MCP تشنه توکن به ابزارهای خط فرمان فشرده تبدیل کرد، قلاب‌های تأیید خودکار را اضافه کرد و جعبه‌شنی ماسه‌بازی همیشه در سطح سیستم عامل را اعمال کرد - اگر جعبه شنی در دسترس نباشد، مهار به‌جای اجرای ابزارهای بدون محافظت، خود را غیرفعال می‌کند.

نتایج معیار، گزارش‌های سرگیجه قابل توجه هستند، اگرچه از ارزیابی‌های خود این شرکت می‌آیند. در Local Knowledge Work Bench داخلی خود - 53 کار شامل تحقیقات عمیق، تجزیه و تحلیل مالی، و ایجاد اسناد، که Perplexity قصد دارد آنها را به صورت متن باز انجام دهد - رایانه ای که Qwen 3.8 27B را روی DGX Spark اجرا می کند، 82.6٪ در مقابل 77.6٪ برای مهار Pi منبع باز و 74.0٪ برای اجرای مدل هرمس به دست آورد. PPLX 27B پس از آموزش Perplexity امتیاز را به 85.4 درصد رساند. در BrowseComp، یک معیار تحقیقاتی وب، رایانه به دقت 66.7٪ در مقابل 50.2٪ برای Pi و 43.9٪ برای Hermes رسید، در حالی که از 51٪ زمان دیوار کمتر و 70٪ توکن کمتر از Pi استفاده می کرد.

نمایندگی های رانندگی Token Economics محلی

منطق استراتژیک در چگونگی تغییر بار کاری هوش مصنوعی آشکار می شود. چت انبوه بود - یک سوال، یک پاسخ، انجام شد. ماموران ساعت ها می دوند. نادر گفت: "با نمایندگان، اگر می‌توانید، می‌خواهید این عوامل همیشه فعال باشند... چیزی که ما می‌بینیم تقاضای سیری ناپذیر برای توکن‌ها است، و این چیزی است که هوش مصنوعی محلی را بسیار عالی می‌کند." "شما با ژتون اندازه گیری نشدید. شما برای ژتون پول نمی دادید."

میانه ترکیبی ممکن است از نظر تجاری جالب ترین نتیجه باشد. در Terminal Bench 2.1، یک معیار چالش برانگیز کدنویسی، مدل کاملاً محلی Qwen با هزینه نهایی صفر امتیاز 59.6% را کسب کرد. اجازه دادن به «مشاور» Claude Opus 5 در فضای ابری، امتیاز را به 73.0 درصد با تخمینی 0.415 دلار برای هر کار افزایش داد، در حالی که اجرای مدل مرزی به تنهایی 82.4 درصد با 0.65 دلار در هر کار را کسب کرد. تشدید تقریباً سه پنجم شکاف تا عملکرد مرزی را با حدود دو سوم هزینه بازیابی کرد - و کاربر تصمیم می‌گیرد چه زمانی معامله ارزش انجام دادن دارد. قبل از هر تماس مشاور، هارنس یک طبقه‌بندی کننده PII را روی زمینه خروجی اجرا می‌کند و به کاربر نشان می‌دهد که دقیقاً چه چیزی دستگاه را ترک می‌کند. مدل راه دور فقط راهنمای متنی را برمی گرداند و هرگز فایل ها یا ابزارهای محلی را لمس نمی کند.

انویدیا همچنین تاکید کرد که سخت‌افزار فراتر از یک جعبه است: اتصال دو DGX Spark بر روی حافظه مشترک، مدل‌های باز کلاس مرزی مانند جدیدترین مدل DeepSeek را اجرا می‌کند، چهار عدد می‌توانند GLM 5.2 یا Nemotron Ultra را اجرا کنند، و نادر گفت که "حتی شاهد اتصال هشت اسپارک بوده است."

این راه‌اندازی همکاری‌ای را گسترش می‌دهد که برای بیش از یک سال ایجاد شده است، پس از اینکه Nvidia و Perplexity همکاری هوش مصنوعی مستقلی را برای ناشران اروپایی و مخابرات در ژوئن 2025 اعلام کردند. برای توسعه‌دهندگانی که مجموعه‌ای از Ollama، مهارهای باز و استنتاج خود میزبان را وزن می‌کنند، رایانه قابل‌حمل، مدل شرط‌بندی و جعبه برنامه، شرط‌بندی مشترک است. چیزی است که در نهایت هوش مصنوعی عامل محلی را به جریان اصلی تبدیل می کند.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →