โครงการโอเพ่นซอร์สที่ไม่ค่อยมีใครรู้จักชื่อ Strata กำลังมีช่วงเวลาหนึ่ง เอ็นจิ้นที่ได้รับลิขสิทธิ์จาก MIT ซึ่งรัน Qwen3.8-Flash-Next ของอาลีบาบา ซึ่งเป็นโมเดลผสมของผู้เชี่ยวชาญที่มีความยาว 125 พันล้านพารามิเตอร์ บนพีซีสำหรับเล่นเกมทั่วไป ขึ้นหน้าแรกของ Hacker News เมื่อวันที่ 4 ตุลาคม ด้วยคะแนนมากกว่า 640 คะแนน และพื้นที่เก็บข้อมูล GitHub ได้รวบรวมดาวมากกว่า 11,000 ดวงนับตั้งแต่ก่อตั้งเมื่อวันที่ 24 กันยายน

การนำเสนอนั้นเรียบง่าย: โมเดล 125 พันล้านพารามิเตอร์ที่ปกติอาศัยอยู่บนเซิร์ฟเวอร์สามารถสนทนา เขียนโค้ด อ่านรูปภาพ และขับเคลื่อนเอเจนต์การเขียนโค้ดทั้งหมดบนกราฟิกการ์ดสำหรับผู้บริโภค โดยไม่มีอะไรออกจากเครื่องเลย

สิ่งที่ Strata ทำได้จริง

Strata เป็นทั้งกลไกการอนุมานและตัวติดตั้งเพียงคลิกเดียวสำหรับ Windows และ Linux ตามเอกสารประกอบ ข้อกำหนดนั้นเรียบง่ายตามมาตรฐานรุ่นชายแดน: GPU ที่มี VRAM อย่างน้อย 12GB จากซีรีย์ RTX 20, 30, 40 หรือ 50 ของ NVIDIA หรือซีรีย์ Radeon RX 6000, 7000 หรือ 9000 ของ AMD, RAM ระบบอย่างน้อย 32GB และพื้นที่ว่าง SSD ประมาณ 80GB

เครื่องยนต์จัดส่ง Qwen3.8-Flash-Next เวอร์ชันเชิงปริมาณที่ระดับการบีบอัดหลายระดับ ตั้งแต่ Q2_0 ไปจนถึง IQ3_S พร้อมด้วยตัวแปรเฉพาะทางโค้ด โดยจะเปิดเผย API ที่เข้ากันได้กับ OpenAI และ Anthropic บน localhost ซึ่งหมายความว่าเครื่องมือที่สร้างขึ้นสำหรับ ChatGPT หรือ Claude รวมถึงเอเจนต์การเขียนโค้ด เช่น Claude Code, Cursor และ Codex สามารถชี้ไปที่เซิร์ฟเวอร์ภายในเครื่องได้โดยมีการเปลี่ยนแปลงเพียงเล็กน้อย รวมอินพุตรูปภาพเสริมและการสนับสนุน multi-GPU ไว้ด้วย และผู้ติดตั้งยังมีโหมดการตั้งค่าที่ได้รับความช่วยเหลือจาก AI ซึ่งช่วยให้ผู้ช่วยเขียนโค้ดกำหนดค่าเครื่องจากพรอมต์ที่วางเพียงครั้งเดียว

ตัวเลขความเร็ว

เกณฑ์มาตรฐานที่เผยแพร่ของโปรเจ็กต์ ซึ่งวัดจากเดสก์ท็อปสำหรับผู้บริโภคสองเครื่อง เป็นสาเหตุที่ทำให้การเผยแพร่เผยแพร่ออกไป บน NVIDIA RTX 5070 พร้อม VRAM ขนาด 12GB จับคู่กับ Ryzen 5 7600 และ RAM ขนาด 64GB Strata รายงาน:

  • การวัดปริมาณของไตรมาส 2_0: 94 โทเค็นต่อวินาทีสำหรับการสร้าง และ 2,650 โทเค็นต่อวินาทีสำหรับการประมวลผลที่รวดเร็วบนเอกสารโทเค็น 32,000 รายการ
  • IQ3_S: 53 โทเค็นต่อรุ่นที่สอง, 1,620 โทเค็นต่อวินาทีในการประมวลผลพร้อมท์
  • ตัวแปร Coder: 55 โทเค็นต่อรุ่นที่สอง

ฝั่ง AMD RX 9070 XT พร้อม VRAM ขนาด 16GB จัดการ 60 โทเค็นต่อวินาทีที่ Q2_0 เอกสารประกอบประมาณการว่า RTX 3090 พร้อม VRAM ขนาด 24GB ควรสูงถึง 100 ถึง 140 โทเค็นต่อวินาที ซึ่งเร็วกว่าที่คนส่วนใหญ่อ่านได้

สำหรับการเปรียบเทียบ เมื่อหกเดือนที่แล้ว การรันแม้แต่โมเดลหนาแน่น 7 หมื่นล้านพารามิเตอร์ภายในเครื่องด้วยความเร็วที่ใช้ได้ จำเป็นต้องใช้เวิร์กสเตชันที่มีหน่วยความจำรวมหลายร้อยกิกะไบต์ หรือมีเทคนิคการถอดรหัสเชิงคาดเดาเชิงรุก

เหตุใดรุ่น 125B จึงพอดีกับการ์ดเกม

เทคโนโลยีสองชิ้นทำให้สิ่งนี้เป็นไปได้ อย่างแรกคือตัวแบบเอง ตามที่ AI Buzz Wire กล่าวถึงในการเปิดตัว Qwen3.8-Flash-Next เป็นสถาปัตยกรรมที่ผสมผสานระหว่างผู้เชี่ยวชาญซึ่งมีพารามิเตอร์ทั้งหมดประมาณ 125 พันล้านพารามิเตอร์ แต่มีการใช้งานเพียงประมาณ 6 พันล้านต่อโทเค็น ดังนั้นแต่ละคำที่สร้างขึ้นจึงสัมผัสกับส่วนเล็กๆ ของเครือข่าย ซึ่งช่วยลดการประมวลผลต่อโทเค็นได้อย่างมาก

ประการที่สองคือการหาปริมาณ ค่าที่ตั้งไว้ล่วงหน้าที่เร็วที่สุดของ Strata จะบีบอัดน้ำหนักของโมเดลให้เหลือสองหรือสามบิตต่อพารามิเตอร์ โดยแลกกับความแม่นยำบางประการสำหรับขนาดที่พอดีกับ GPU ขนาด 12GB และ RAM ของระบบ ข้อเสียเปรียบดังกล่าวเป็นข้อแม้หลัก: ปริมาณคลาส Q2 และ IQ2 สามารถลดคุณภาพในงานที่ใช้เหตุผลจำนวนมากได้อย่างวัดผลได้ และผู้ซื้อควรถือว่าตัวเลขความเร็วพาดหัวเป็นจุดเริ่มต้นมากกว่าการรับประกันสำหรับทุกปริมาณงาน หน้าเกณฑ์มาตรฐานของชุมชนในผลลัพธ์คุณภาพการติดตามพื้นที่เก็บข้อมูลในขนาดต่างๆ

ส่วนหนึ่งของคลื่น Local-AI ที่ใหญ่กว่า

Strata มาถึงท่ามกลางแรงผลักดันที่เร่งขึ้นสำหรับการอนุมานในท้องถิ่น ตระกูล Qwen ของ Alibaba กลายเป็นกลุ่มผลิตภัณฑ์รุ่นเปิดที่มีการดาวน์โหลดมากที่สุด Meta และ Google มีโมเดลการแข่งขันแบบโอเพ่นซอร์สของตนเอง และตอนนี้เครื่องมือมากมายช่วยให้ผู้บริโภคเรียกใช้ผู้ช่วยที่มีความสามารถได้โดยไม่ต้องสมัครสมาชิกหรือข้อมูลออกจากอุปกรณ์

โครงการนี้ยังสะท้อนให้เห็นถึงการเปลี่ยนแปลงของคำจำกัดความของ "ฮาร์ดแวร์สำหรับผู้บริโภค" กราฟิกการ์ดระดับกลางปี ​​2026 ที่มี VRAM ขนาด 12GB ซึ่งจัดส่งมาเพื่อการเล่นเกมเป็นหลัก ปัจจุบันเป็นตัวเร่งการอนุมานที่มีประสิทธิภาพสำหรับรุ่นในระดับขนาดที่กำหนดระบบชายแดนเมื่อสองปีที่แล้ว

Strata ยังคงเป็นซอฟต์แวร์ยุคแรกๆ — ตัวติดตามปัญหาของพื้นที่เก็บข้อมูลจะบันทึกขอบคร่าวๆ บน GPU รุ่นเก่าและโปรเซสเซอร์ที่ไม่ใช่ AVX2 — แต่โปรเจ็กต์นี้ได้รับลิขสิทธิ์จาก MIT ฟรี และพัฒนาแบบเปิด พร้อมการสนับสนุนการทดลองสำหรับ Intel Arc, การ์ด Tesla และ Radeon รุ่นเก่า และแท่นขุดเจาะ GPU หลายตัวที่บันทึกโดยสมาชิกในชุมชน

สำหรับนักพัฒนา สิ่งที่นำไปใช้ได้จริงมากที่สุดอาจเป็นความเข้ากันได้ของ localhost API: สคริปต์หรือเอเจนต์ใดๆ ที่เขียนต่อต้าน OpenAI หรือ Anthropic SDK สามารถเปลี่ยนเส้นทางไปยังการปรับใช้ Qwen ในเครื่องได้โดยการเปลี่ยน URL พื้นฐาน ทำให้ Strata เป็นตัวเลือกที่มีแรงเสียดทานต่ำสำหรับการสร้างต้นแบบที่ไวต่อความเป็นส่วนตัว การใช้งานออฟไลน์ หรือเพียงแค่จำกัดการใช้จ่าย API

วิธีทดลองใช้

การเริ่มต้นใช้งานไม่จำเป็นต้องมีเซสชันเทอร์มินัลพร้อมคู่มือ โปรแกรมติดตั้งจะจัดเตรียมไดรเวอร์ น้ำหนักโมเดล และเซิร์ฟเวอร์ภายในเครื่องไว้ในครั้งเดียว และพื้นที่เก็บข้อมูลจะมีไฟล์การตั้งค่าที่ออกแบบมาเพื่อวางลงในผู้ช่วยเขียนโค้ด AI โดยตรง ซึ่งจะกำหนดค่าเครื่องโดยอัตโนมัติ การเปิดตัวครั้งแรกจะช้าลงในขณะที่โหลดน้ำหนักจากดิสก์ เอกสารแนะนำ SSD และเตือนว่าการสนทนาที่ยาวนานจะเปลี่ยนงานไปที่ RAM ของระบบมากขึ้น

ก้าวนำหน้า AI

ติดตาม AI Buzz Wire เพื่อดูข้อมูลล่าสุดเกี่ยวกับโมเดลโอเพ่นซอร์ส เครื่องมือ AI ในพื้นที่ และฮาร์ดแวร์การอนุมาน

อ่านข่าว AI เพิ่มเติม →