Perplexity ได้เปิดตัว Portable Computer ซึ่งเป็นเวอร์ชันหนึ่งของแพลตฟอร์ม "คอมพิวเตอร์" แบบเอเจนต์ที่ทำงานบนผู้ใช้ฮาร์ดแวร์ที่มีอยู่แล้ว โดยเริ่มจากซูเปอร์คอมพิวเตอร์เดสก์ท็อป DGX Spark ของ Nvidia และเครื่อง Linux ที่ติดตั้ง RTX GPU ได้รับการพัฒนาโดยความร่วมมืออย่างใกล้ชิดกับ Nvidia และประกาศเมื่อวันที่ 25 สิงหาคม 2026 นี่เป็นหนึ่งในความพยายามเชิงรุกมากที่สุดที่จะย้ายปริมาณงานของตัวแทน AI ที่จริงจังออกจากระบบคลาวด์และไปยังอุปกรณ์ในเครื่อง

การนำเสนอนั้นเรียบง่ายแต่เป็นผลสืบเนื่อง: โมเดล ไฟล์ของผู้ใช้ และตัวงานเองทั้งหมดสามารถอยู่บนเครื่องได้ งานที่เสร็จสิ้นภายในเครื่องไม่ต้องใช้เครดิตการเรียกเก็บเงิน ทุกงานจะเริ่มต้นบนอุปกรณ์ตามค่าเริ่มต้น และระบบจะขออนุญาตก่อนที่จะส่งแต่ละขั้นตอนไปยังโมเดลชายแดนที่มีประสิทธิภาพยิ่งขึ้นในระบบคลาวด์ For more context on this story, see our ongoing more AI stories.

"โดยพื้นฐานแล้วเราได้นำ UI ที่เหมือนกันทุกประการมาสู่แอปท้องถิ่นโดยสมบูรณ์" Nate รองประธานฝ่ายวิศวกรรมสำหรับโครงสร้างพื้นฐานและองค์กรของ Perplexity กล่าวระหว่างการแถลงข่าวเมื่อวันจันทร์ "สิ่งนี้รวมเอาการควบคุมและการอนุมานของตัวแทนทั้งหมด และทุกสิ่งที่จำเป็นในการทำงานในพื้นที่"

สำหรับ Nvidia ซึ่งใช้เวลาสองปีที่ผ่านมาในการขายโลกบนศูนย์ข้อมูล AI มูลค่าล้านล้านดอลลาร์ การประกาศดังกล่าวมีข้อความที่ละเอียดกว่านั้น: ผู้ผลิตชิปเชื่อว่า AI ในท้องถิ่นได้ก้าวข้ามเกณฑ์จากความอยากรู้อยากเห็นของมือสมัครเล่นไปสู่เครื่องมือที่ใช้งานได้จริง “AI ในพื้นที่มาถึงจุดเปลี่ยนแล้ว” Nader ผู้อำนวยการฝ่ายพัฒนาเทคโนโลยีของ Nvidia กล่าว "เป็นเวลานานที่สุดแล้วที่มันเป็นงานอดิเรกและผู้สนใจ... การใช้โมเดลเชิงปริมาณเหล่านี้โดยลดขนาดให้เหลือน้อยมาก และถึงแม้จะดูเจ๋ง แต่ก็ใช้งานไม่ได้จริงนัก แต่สิ่งที่เปลี่ยนไปด้วยโมเดลโอเพ่นซอร์สใหม่ๆ เหล่านี้"

สแต็ก AI ท้องถิ่นเต็มรูปแบบในแอปเดียว

Perplexity Computer ผลิตภัณฑ์คลาวด์ ประสานโมเดล ไฟล์ เครื่องมือ และการเข้าถึงเว็บเพื่อทำงานให้ความรู้แบบหลายขั้นตอน — ตรวจทานโฟลเดอร์ของเอกสาร วิเคราะห์ข้อมูล และจัดทำรายงาน คอมพิวเตอร์พกพาจะจำลองแบบดังกล่าวภายในเครื่อง โดยรวมโมเดลในเครื่อง ชุดควบคุมตัวแทน กลไกการอนุมาน เครื่องมือ ตัวเชื่อมต่อแอป และแซนด์บ็อกซ์ความปลอดภัยไว้ในแอปพลิเคชันเดียว การรวมกลุ่มมีความสำคัญ: ด้วยสแต็ก AI ในพื้นที่ส่วนใหญ่ในปัจจุบัน ผู้ใช้จะต้องประกอบชิ้นส่วนเหล่านั้นด้วยตนเอง — การดาวน์โหลดตุ้มน้ำหนัก การยืนเซิร์ฟเวอร์การอนุมาน และการเดินสายเครื่องมือเข้าด้วยกัน

ในการแถลงข่าว ระบบจะเล่นโดยนักลงทุนรายย่อยที่กำลังตรวจสอบโฟลเดอร์ 1,099 และเอกสารการลงทุน ซึ่งเป็นเนื้อหาทางการเงินที่ละเอียดอ่อนที่ผู้ใช้หลายคนลังเลที่จะอัปโหลดไปยังบริการคลาวด์ การใช้โมเดล Qwen พารามิเตอร์ 27 พันล้านพารามิเตอร์ที่ใช้งาน GPU เต็มรูปแบบบน DGX Spark ตัวแทนจะแจ้งกรณีที่นักลงทุนจ่ายค่าธรรมเนียมที่ไม่จำเป็น องค์ประกอบอินเทอร์เฟซที่ปกตินับเครดิตคลาวด์ Perplexity ตั้งข้อสังเกตว่า "จอดอยู่ที่ศูนย์"

ผลิตภัณฑ์นี้ยังเป็นแบบไฮบริดมากกว่าแบบสุญญากาศ การสาธิตครั้งที่สองวิเคราะห์ CSV ของข้อมูลช่องทางผู้ใช้ในเครื่อง จากนั้นส่งการวิเคราะห์ที่เสร็จสิ้นแล้วไปยัง Slack โดยใช้ระบบนิเวศของตัวเชื่อมต่อของ Perplexity ระบบเชื่อมต่อกับ Google Drive, Gmail และ GitHub และสามารถเพิ่มระดับเป็นโมเดลคลาวด์ระดับแนวหน้าได้เมื่อโมเดลในเครื่องถึงขีดจำกัด

ข้อกำหนดและความพร้อมใช้งาน

เมื่อเปิดตัว ผู้ใช้สามารถรัน Qwen 3.8 27B หรือ PPLX 27B ซึ่งเป็นเวอร์ชัน Perplexity ที่ได้รับการฝึกฝนหลังการฝึกอบรมบนสายรัดของตัวเอง โดยมาพร้อมกับ Nemotron 3.5 Lightning ของ Nvidia ในเร็วๆ นี้ ระบบใช้ vLLM เพื่อโฮสต์การอนุมานข้างใต้ พร้อมด้วยโหมดขั้นสูงสำหรับผู้ใช้ที่ต้องการเสียบอุปกรณ์ปลายทางของตนเอง RTX GPU ใดๆ ที่มี VRAM อย่างน้อย 24GB หรือประมาณ GeForce RTX 3090 หรือใหม่กว่า จะช่วยล้างแถบนี้ได้

Portable Computer พร้อมใช้งานแล้วสำหรับสมาชิก Pro, Max, Enterprise Pro และ Enterprise Max บน Linux โดยจะรองรับ Windows ในเดือนกันยายน

ร่วมออกแบบโมเดลและสายรัด

นอกเหนือจากการเปิดตัวแล้ว Perplexity ยังตีพิมพ์ผลงานวิจัยที่โต้แย้งว่าตัวแทนในพื้นที่ที่มีประสิทธิภาพจำเป็นต้องมีโมเดลและการควบคุมตัวแทน ซึ่งก็คือโครงสร้างคำแนะนำ เครื่องมือ และตรรกะในการจัดประสาน ที่จะได้รับการออกแบบร่วมกัน ชุดบังเหียนสำหรับใช้งานทั่วไปถือเป็นโมเดลชายแดนที่สามารถดูดซับบริบทจำนวนมหาศาลและนำทางไปยังพื้นผิวเครื่องมือที่แผ่กิ่งก้านสาขา รุ่นท้องถิ่นขนาดเล็กหัวเข็มขัดภายใต้ความต้องการเหล่านั้น ความฉงนสนเท่ห์พบว่าแม้ว่า Qwen 3.8 27B จะโฆษณาหน้าต่างบริบท 260,000 โทเค็น แต่มันก็เริ่มดิ้นรนเกินกว่า 100,000 โทเค็น

คำตอบของบริษัทคือจงใจควบคุมให้น้อยที่สุด: ข้อความแจ้งของระบบที่กระชับ ชุดเครื่องมือหลักชุดเล็กๆ และความสามารถที่โหลดและยกเลิกการโหลดเป็น "ทักษะ" ตามความต้องการ โดยแปลงตัวเชื่อมต่อยอดนิยม เช่น Gmail และ GitHub จากเซิร์ฟเวอร์ MCP ที่ใช้โทเค็นจำนวนมากไปเป็นเครื่องมือบรรทัดคำสั่งขนาดกะทัดรัด เพิ่มฮุคการยืนยันตัวเอง และบังคับใช้แซนด์บ็อกซ์ระดับระบบปฏิบัติการที่ทำงานตลอดเวลา — หากแซนด์บ็อกซ์ไม่พร้อมใช้งาน ชุดควบคุมจะปิดตัวเองแทนที่จะเรียกใช้เครื่องมือโดยไม่มีการป้องกัน

รายงาน Perplexity ของผลลัพธ์เกณฑ์มาตรฐานนั้นโดดเด่น แม้ว่าจะมาจากการประเมินของบริษัทเองก็ตาม ในงาน Local Knowledge Work Bench ภายในของบริษัท — งาน 53 งานที่ครอบคลุมการวิจัยเชิงลึก การวิเคราะห์ทางการเงิน และการสร้างเอกสาร ซึ่ง Perplexity วางแผนที่จะเปิดแหล่งที่มา — คอมพิวเตอร์ที่ใช้ Qwen 3.8 27B บน DGX Spark ได้คะแนน 82.6% เทียบกับ 77.6% สำหรับสายรัด Pi แบบโอเพ่นซอร์ส และ 74.0% สำหรับ Hermes ที่ใช้รุ่นที่เหมือนกัน PPLX 27B ที่ผ่านการฝึกอบรมหลังการฝึกของ Perplexity ดันคะแนนไปที่ 85.4% ใน BrowserComp ซึ่งเป็นเกณฑ์มาตรฐานการวิจัยเว็บ คอมพิวเตอร์มีความแม่นยำ 66.7% เทียบกับ 50.2% สำหรับ Pi และ 43.9% สำหรับ Hermes ในขณะที่ใช้เวลาน้อยลง 51% และโทเค็นน้อยกว่า Pi 70%

The Token Economics ขับเคลื่อนตัวแทนท้องถิ่น

ตรรกะเชิงกลยุทธ์มีความชัดเจนว่าปริมาณงาน AI เปลี่ยนแปลงไปอย่างไร การแชทระเบิดอย่างรวดเร็ว ทั้งคำถาม คำตอบ เสร็จแล้ว ตัวแทนทำงานเป็นเวลาหลายชั่วโมง “สำหรับตัวแทน คุณต้องการให้ตัวแทนเหล่านี้ทำงานอยู่เสมอหากทำได้... สิ่งที่เราเห็นคือความต้องการโทเค็นที่ไม่รู้จักพอ และนั่นคือสิ่งที่ทำให้ AI ในท้องถิ่นยอดเยี่ยมมาก” Nader กล่าว “คุณไม่ได้ถูกวัดโดยโทเค็น คุณไม่ได้จ่ายค่าโทเค็น”

พื้นกลางแบบไฮบริดอาจเป็นผลลัพธ์ที่น่าสนใจที่สุดในเชิงพาณิชย์ บน Terminal Bench 2.1 ซึ่งเป็นเกณฑ์มาตรฐานการเข้ารหัสที่ท้าทาย โมเดล Qwen ในพื้นที่เต็มรูปแบบได้คะแนน 59.6% โดยมีต้นทุนส่วนเพิ่มเป็นศูนย์ การปล่อยให้ยกระดับเป็น "ที่ปรึกษา" ของ Claude Opus 5 ในระบบคลาวด์ ทำให้คะแนนเพิ่มขึ้นเป็น 73.0% ที่ประมาณ 0.415 ดอลลาร์ต่องาน ในขณะที่การรันโมเดล frontier เพียงอย่างเดียวได้คะแนน 82.4% ที่ 0.65 ดอลลาร์ต่องาน การยกระดับช่วยฟื้นคืนช่องว่างประมาณสามในห้าของประสิทธิภาพการทำงานระดับแนวหน้าด้วยต้นทุนประมาณสองในสาม — และผู้ใช้จะตัดสินใจว่าเมื่อใดที่การค้าจะคุ้มค่า ก่อนที่จะโทรหาที่ปรึกษาใดๆ ชุดควบคุมจะเรียกใช้ตัวแยกประเภท PII บนบริบทขาออก และแสดงให้ผู้ใช้เห็นอย่างชัดเจนถึงสิ่งที่จะออกจากอุปกรณ์ โมเดลระยะไกลส่งคืนคำแนะนำด้วยข้อความเท่านั้นและจะไม่แตะต้องไฟล์หรือเครื่องมือในเครื่อง

Nvidia ยังเน้นย้ำอีกว่าฮาร์ดแวร์มีขนาดเกินกว่ากล่องเดียว: การเชื่อมต่อ DGX Sparks สองตัวผ่านหน่วยความจำที่ใช้ร่วมกันจะเป็นรุ่นเปิดระดับแนวหน้าเช่นรุ่นล่าสุดของ DeepSeek, สี่ตัวสามารถรัน GLM 5.2 หรือ Nemotron Ultra และ Nader กล่าวว่าเขา "เคยเห็น Sparks แปดตัวเชื่อมต่อกันด้วยซ้ำ"

การเปิดตัวดังกล่าวเป็นการขยายความร่วมมือที่ก่อตั้งมานานกว่าหนึ่งปี หลังจากที่ Nvidia และ Perplexity ประกาศความร่วมมือด้าน AI อธิปไตยสำหรับผู้เผยแพร่โฆษณาและโทรคมนาคมในยุโรปในเดือนมิถุนายน 2568 สำหรับนักพัฒนาที่ชั่งน้ำหนัก Ollama แบบ DIY, สายรัดแบบเปิด และการอนุมานแบบโฮสต์เอง เดิมพันของคอมพิวเตอร์พกพาก็คือประสบการณ์ที่เหมือนกับอุปกรณ์ เช่น โมเดลที่ออกแบบร่วมกัน ชุดสายรัด และแซนด์บ็อกซ์ คือสิ่งที่ทำให้ AI ตัวแทนในท้องถิ่นเป็นกระแสหลักในที่สุด

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →