Perplexity کامپیوتر قابل حمل را راهاندازی کرده است، نسخهای از پلتفرم عامل خود "رایانه" که به طور کامل بر روی سخت افزاری که کاربران از قبل در اختیار دارند اجرا میشود – از ابررایانههای رومیزی DGX Spark انویدیا و ماشینهای لینوکس مجهز به پردازندههای گرافیکی RTX شروع میشود. این برنامه که با همکاری نزدیک با انویدیا توسعه یافته و در 25 آگوست 2026 اعلام شد، یکی از تهاجمیترین تلاشهایی است که تاکنون برای انتقال حجم کار جدی عامل هوش مصنوعی از فضای ابری و روی دستگاههای محلی انجام شده است.
گام ساده اما پیامد است: مدل، فایلهای کاربر و خود کار همگی میتوانند روی دستگاه باقی بمانند. کاری که به صورت محلی انجام میشود، هیچ اعتبار صورتحساب مصرف نمیکند، هر کار بهطور پیشفرض روی دستگاه شروع میشود، و سیستم قبل از ارسال هر مرحله جداگانه به یک مدل مرزی قدرتمندتر در ابر، اجازه میگیرد. For more context on this story, see our ongoing AI industry coverage.
نیت، معاون مهندسی زیرساخت و سازمانی Perplexity، در یک نشست مطبوعاتی در روز دوشنبه گفت: «ما اساساً دقیقاً همان رابط کاربری را به یک برنامه کاملاً محلی آوردهایم. "این شامل کل مهار عامل و استنتاج و همه چیزهایی است که برای انجام کار به صورت محلی لازم است."
برای انویدیا، که دو سال گذشته را صرف فروش دنیا بر روی مراکز داده هوش مصنوعی تریلیون دلاری کرده است، این اعلامیه پیام ظریف تری را به همراه دارد: سازنده تراشه معتقد است هوش مصنوعی محلی از آستانه کنجکاوی سرگرمی به ابزار عملی عبور کرده است. نادر، مدیر فناوری توسعه دهندگان انویدیا گفت: هوش مصنوعی محلی به نقطه عطف رسیده است. "برای طولانی ترین زمان، علاقه مندان و علاقه مندان بودند... اجرای این مدل های کوانتیزه شده به صورت کوانتیزه شده بسیار کوچک است. و با وجود اینکه جالب است، فوق العاده عملی نیست. اما همه چیز با بسیاری از این مدل های منبع باز جدید تغییر کرد."
پشته کامل هوش مصنوعی محلی در یک برنامه
Perplexity Computer، محصول ابری، مدلها، فایلها، ابزارها و دسترسی به وب را برای تکمیل وظایف چند مرحلهای دانش - بررسی پوشههای اسناد، تجزیه و تحلیل دادهها، و تولید گزارشها هماهنگ میکند. رایانه قابل حمل آن را به صورت محلی تکرار میکند، مدلهای محلی، مهار عامل، موتور استنتاج، ابزارها، رابطهای برنامه و یک جعبه ایمنی امنیتی را در یک برنامه واحد ترکیب میکند. بستهبندی مهم است: امروزه با اکثر پشتههای هوش مصنوعی محلی، کاربران باید خودشان آن قطعات را جمعآوری کنند - بارگیری وزنها، ایستادن یک سرور استنتاج و ابزارهای سیمکشی با هم.
در یک نسخه نمایشی مطبوعاتی، سیستم نقش سرمایهگذار خردهفروشی را بازی کرد که در حال بررسی پوشهای از 1099s و اسناد سرمایهگذاری بود – نوعی از مطالب مالی حساس که بسیاری از کاربران در آپلود آن در سرویس ابری تردید دارند. با اجرای یک مدل Qwen با 27 میلیارد پارامتر با استفاده کامل از GPU بر روی DGX Spark، این نماینده مواردی را که سرمایهگذار هزینههای غیرضروری پرداخت میکرد، علامتگذاری کرد. Perplexity اشاره کرد که عنصر رابط که معمولاً اعتبارات ابری را محاسبه می کند، "فقط روی صفر پارک شده است."
این محصول نیز به جای هرمتیک، هیبریدی است. نسخه ی نمایشی دوم CSV داده های قیف کاربر را به صورت محلی تجزیه و تحلیل کرد، سپس تجزیه و تحلیل نهایی را با استفاده از اکوسیستم رابط Perplexity به Slack منتقل کرد. این سیستم به Google Drive، Gmail و GitHub متصل میشود و زمانی که مدل محلی به محدودیتهای خود برسد، میتواند به یک مدل ابر مرزی تبدیل شود.
الزامات و در دسترس بودن
در زمان راهاندازی، کاربران میتوانند Qwen 3.8 27B یا PPLX 27B را اجرا کنند - نسخهای که Perplexity بر روی مهار خود آموزش داده است - با Nemotron 3.5 Lightning انویدیا به زودی. این سیستم از vLLM برای میزبانی استنتاج در زیر استفاده میکند، با یک حالت پیشرفته برای کاربرانی که میخواهند نقطه پایانی خود را وصل کنند. هر پردازنده گرافیکی RTX با حداقل 24 گیگابایت VRAM، تقریباً GeForce RTX 3090 یا جدیدتر، نوار را پاک می کند.
رایانه قابل حمل اکنون برای مشترکین Pro، Max، Enterprise Pro و Enterprise Max در لینوکس در دسترس است و ویندوز در ماه سپتامبر پشتیبانی می کند.
طراحی مشترک مدل و هارنس
در کنار پرتاب، Perplexity یک مقاله تحقیقاتی منتشر کرد که در آن استدلال میکرد که عوامل محلی مؤثر نیاز دارند که مدل و مهار عامل - داربست اعلانها، ابزارها و منطق ارکستراسیون - با هم طراحی شوند. مهارهای همه منظوره مدلهای مرزی را در نظر میگیرند که میتوانند زمینههای عظیم را جذب کنند و سطوح ابزار گسترده را هدایت کنند. مدل های کوچک محلی تحت این خواسته ها دست و پنجه نرم می کنند. Perplexity دریافت که اگرچه Qwen 3.8 27B یک پنجره زمینه 260000 توکن را تبلیغ می کند، اما بیش از 100000 توکن شروع به مبارزه می کند.
پاسخ این شرکت یک مهار عمداً حداقلی است: یک سیستم مختصر، مجموعه کوچکی از ابزارهای اصلی، و قابلیتهایی که به عنوان «مهارتهای» درخواستی بارگیری و تخلیه میشوند. این کانکتورهای محبوب مانند Gmail و GitHub را از سرورهای MCP تشنه توکن به ابزارهای خط فرمان فشرده تبدیل کرد، قلابهای تأیید خودکار را اضافه کرد و جعبهشنی ماسهبازی همیشه در سطح سیستم عامل را اعمال کرد - اگر جعبه شنی در دسترس نباشد، مهار بهجای اجرای ابزارهای بدون محافظت، خود را غیرفعال میکند.
نتایج معیار، گزارشهای سرگیجه قابل توجه هستند، اگرچه از ارزیابیهای خود این شرکت میآیند. در Local Knowledge Work Bench داخلی خود - 53 کار شامل تحقیقات عمیق، تجزیه و تحلیل مالی، و ایجاد اسناد، که Perplexity قصد دارد آنها را به صورت متن باز انجام دهد - رایانه ای که Qwen 3.8 27B را روی DGX Spark اجرا می کند، 82.6٪ در مقابل 77.6٪ برای مهار Pi منبع باز و 74.0٪ برای اجرای مدل هرمس به دست آورد. PPLX 27B پس از آموزش Perplexity امتیاز را به 85.4 درصد رساند. در BrowseComp، یک معیار تحقیقاتی وب، رایانه به دقت 66.7٪ در مقابل 50.2٪ برای Pi و 43.9٪ برای Hermes رسید، در حالی که از 51٪ زمان دیوار کمتر و 70٪ توکن کمتر از Pi استفاده می کرد.
نمایندگی های رانندگی Token Economics محلی
منطق استراتژیک در چگونگی تغییر بار کاری هوش مصنوعی آشکار می شود. چت انبوه بود - یک سوال، یک پاسخ، انجام شد. ماموران ساعت ها می دوند. نادر گفت: "با نمایندگان، اگر میتوانید، میخواهید این عوامل همیشه فعال باشند... چیزی که ما میبینیم تقاضای سیری ناپذیر برای توکنها است، و این چیزی است که هوش مصنوعی محلی را بسیار عالی میکند." "شما با ژتون اندازه گیری نشدید. شما برای ژتون پول نمی دادید."
میانه ترکیبی ممکن است از نظر تجاری جالب ترین نتیجه باشد. در Terminal Bench 2.1، یک معیار چالش برانگیز کدنویسی، مدل کاملاً محلی Qwen با هزینه نهایی صفر امتیاز 59.6% را کسب کرد. اجازه دادن به «مشاور» Claude Opus 5 در فضای ابری، امتیاز را به 73.0 درصد با تخمینی 0.415 دلار برای هر کار افزایش داد، در حالی که اجرای مدل مرزی به تنهایی 82.4 درصد با 0.65 دلار در هر کار را کسب کرد. تشدید تقریباً سه پنجم شکاف تا عملکرد مرزی را با حدود دو سوم هزینه بازیابی کرد - و کاربر تصمیم میگیرد چه زمانی معامله ارزش انجام دادن دارد. قبل از هر تماس مشاور، هارنس یک طبقهبندی کننده PII را روی زمینه خروجی اجرا میکند و به کاربر نشان میدهد که دقیقاً چه چیزی دستگاه را ترک میکند. مدل راه دور فقط راهنمای متنی را برمی گرداند و هرگز فایل ها یا ابزارهای محلی را لمس نمی کند.
انویدیا همچنین تاکید کرد که سختافزار فراتر از یک جعبه است: اتصال دو DGX Spark بر روی حافظه مشترک، مدلهای باز کلاس مرزی مانند جدیدترین مدل DeepSeek را اجرا میکند، چهار عدد میتوانند GLM 5.2 یا Nemotron Ultra را اجرا کنند، و نادر گفت که "حتی شاهد اتصال هشت اسپارک بوده است."
این راهاندازی همکاریای را گسترش میدهد که برای بیش از یک سال ایجاد شده است، پس از اینکه Nvidia و Perplexity همکاری هوش مصنوعی مستقلی را برای ناشران اروپایی و مخابرات در ژوئن 2025 اعلام کردند. برای توسعهدهندگانی که مجموعهای از Ollama، مهارهای باز و استنتاج خود میزبان را وزن میکنند، رایانه قابلحمل، مدل شرطبندی و جعبه برنامه، شرطبندی مشترک است. چیزی است که در نهایت هوش مصنوعی عامل محلی را به جریان اصلی تبدیل می کند.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →