Cerebras ได้เพิ่ม Qwen 3.8 27B ไปยังจุดสิ้นสุดสาธารณะของแพลตฟอร์ม Cerebras Inference โดยที่โมเดล open-weights ทำงานที่ประมาณ 1,500 โทเค็นต่อวินาที ตามเอกสารแคตตาล็อกโมเดลของบริษัท รายชื่อดังกล่าวทำให้หนึ่งในตระกูลโมเดลแบบเปิดที่ใช้กันอย่างแพร่หลายที่สุดของอาลีบาบามีความเร็วซึ่งด้อยกว่าการให้บริการที่โฮสต์โดย GPU ทั่วไป
การประกาศดังกล่าวดึงดูดความสนใจจากนักพัฒนาทันที: เรื่องราวดังกล่าวรวบรวมมากกว่า 600 คะแนนใน Hacker News ภายในหนึ่งวัน ซึ่งเป็นระดับที่น่าดึงดูดซึ่งสะท้อนให้เห็นว่าความต้องการการอนุมานที่รวดเร็วและราคาถูกนั้นร้อนแรงเพียงใด หากต้องการดูตลาดการอนุมานที่กว้างขึ้น โต๊ะ ข่าวด่วน AI จะติดตามการอัปเดตแพลตฟอร์มหลักทุกรายการเมื่อมาถึง
ข้อมูลจำเพาะในแคตตาล็อก
เอกสารของ Per Cerebras นั้น Qwen 3.8 27B มีพารามิเตอร์ 27 พันล้านพารามิเตอร์ และรองรับโทเค็นบริบท 64,000 รายการในระดับฟรี และ 128,000 ในระดับที่ชำระเงิน โดยทำงานที่ประมาณ 1,500 โทเค็นต่อวินาที มันอยู่เคียงข้างโมเดล GPT-OSS 120B แบบน้ำหนักเปิดของ OpenAI ซึ่งมีรายการแค็ตตาล็อกเดียวกันที่ประมาณ 3,000 โทเค็นต่อวินาที โดยมีบริบท 65,000 รายการสำหรับรุ่นฟรี และ 131,000 รายการสำหรับรุ่นที่ต้องชำระเงิน
ทั้งสองรุ่นมีให้ทดลองใช้ฟรีของ Cerebras และแบบจ่ายตามการใช้งาน โดยขึ้นอยู่กับขีดจำกัดอัตรา ลูกค้าที่ต้องการความจุที่สงวนไว้ ปริมาณงานที่สูงขึ้น หรือ SLA การผลิตจะถูกส่งไปยังข้อเสนออุปกรณ์ปลายทางเฉพาะของบริษัท ซึ่งเอกสารยังระบุเป็นเส้นทางไปยังตระกูลโมเดลเพิ่มเติมที่เกินกว่าทั้งสองในอุปกรณ์ปลายทางสาธารณะ
หน้าต่างบริบทสมควรได้รับความสนใจควบคู่ไปกับตัวเลขความเร็ว โทเค็นหกหมื่นสี่พันโทเค็นบน Free Tier และ 128,000 โทเค็นแบบชำระเงิน เพียงพอที่จะเก็บโค้ดเบสขนาดใหญ่ เอกสารขนาดยาว หรือทรานสคริปต์เอเจนต์แบบขยายไว้ในหน่วยความจำในคราวเดียว ซึ่งมีความสำคัญต่อปริมาณงานที่แน่นอนซึ่งการถอดรหัสที่รวดเร็วจะให้ผลตอบแทนที่ดี เอกสารของ Cerebras ยังรวมถึงคู่มือความเข้ากันได้ของ OpenAI ซึ่งช่วยลดต้นทุนการสลับสำหรับทีมที่มีโค้ดที่มีอยู่กำหนดเป้าหมายไปที่ OpenAI SDK อยู่แล้ว โดยหลักการแล้ว การชี้ไคลเอ็นต์ที่มีอยู่ไปที่ตำแหน่งข้อมูล Cerebras เป็นการเปลี่ยนแปลงการกำหนดค่ามากกว่าการเขียนใหม่
โมเดลที่ไม่ได้ตัดแต่ง การบีบอัดแบบโปร่งใส
รายละเอียดประการหนึ่งที่ควรสังเกตในเอกสารประกอบคือการเปิดเผยของ Cerebras เกี่ยวกับวิธีการจัดการการบีบอัดโมเดล บริษัทระบุว่าโมเดลทั้งหมดบนอุปกรณ์ปลายทางสาธารณะเป็นเวอร์ชันดั้งเดิมและไม่มีการตัดแต่ง และใช้การวัดปริมาณเฉพาะน้ำหนักเฉพาะเฉพาะระหว่างการจัดเก็บเพื่อรักษาคุณภาพ เลเยอร์ที่ละเอียดอ่อนจะคงความแม่นยำสูงสุด การเปิดใช้งาน ความสนใจ และแคช KV ยังคงไม่ถูกระบุปริมาณ และการแยกส่วนจะเกิดขึ้นทันที
นอกจากนี้ Cerebras ยังเปิดเผยการวิจัยเกี่ยวกับเทคนิคการตัดแต่งกิ่ง เช่น REAP (การตัดแต่งกิ่งโดยผู้เชี่ยวชาญที่ถ่วงน้ำหนักด้วยเราเตอร์): ตัวแปรที่ตัดแต่งแล้วจะถูกแชร์กับชุมชนการวิจัยบน Hugging Face แต่ไม่ได้ให้บริการผ่าน API สาธารณะ สำหรับนักพัฒนาที่เลือกว่าจะเรียกใช้โมเดลแบบเปิดที่ใด ความโปร่งใสเกี่ยวกับสิ่งที่ให้บริการนั้นชัดเจนผิดปกติ
เหตุใดความเร็วของโทเค็นจึงมีความสำคัญ
จำนวนปริมาณการประมวลผลเช่นนี้มีความสำคัญมากที่สุดสำหรับปริมาณงานด้านเอเจนต์และการเขียนโค้ด แอปพลิเคชันที่เชื่อมโยงการเรียกโมเดลหลายร้อยรายการ — เอเจนต์การเขียนโค้ด เวิร์กโฟลว์อัตโนมัติ ผู้ช่วยแบบเรียลไทม์ — คูณเวลาแฝงต่อโทเค็นในทุกขั้นตอน ดังนั้นความแตกต่างระหว่าง 50 ถึง 1,500 โทเค็นต่อวินาทีจึงรวมกันเป็นประสบการณ์ที่แตกต่างในเชิงคุณภาพ แอปพลิเคชันแบบโต้ตอบที่สตรีมต่อเนื่องยาวนานจะได้รับประโยชน์อย่างเห็นได้ชัดที่สุด
การแลกเปลี่ยนเป็นขอบเขต แบบจำลองที่มีพารามิเตอร์ 27 พันล้านพารามิเตอร์จะไม่ตรงกับระบบชายแดนในงานการให้เหตุผลที่ยากที่สุด และเอกสารของ Cerebras เองจะคัดท้ายปริมาณงานการผลิตจำนวนมากไปสู่ความสามารถเฉพาะด้าน แต่สำหรับงานระดับกลางขนาดใหญ่ซึ่งโมเดลแบบเปิดขนาดกลางนั้นดีเพียงพออยู่แล้ว ไม่ว่าจะเป็นการสรุป การจัดหมวดหมู่ การใช้เครื่องมือ การแก้ไขโค้ด ความเร็วจะกลายเป็นสิ่งที่สร้างความแตกต่าง
นอกจากนี้ยังมีมิติราคาที่นักพัฒนาจะต้องชั่งน้ำหนัก โมเดลจุดสิ้นสุดสาธารณะสามารถใช้งานได้ในช่วงทดลองใช้ฟรีก่อนมีข้อผูกมัดใดๆ ซึ่งทำให้การเปรียบเทียบประสิทธิภาพกับปริมาณงานของทีมนั้นไม่มีอุปสรรคใดๆ — การเพิ่มระดับโดยเจตนาซึ่งตรงกันข้ามกับสัญญาระดับองค์กรที่ต้องมีการสนทนาด้านการขายก่อนที่จะเสิร์ฟโทเค็นแรก ขีดจำกัดอัตราที่บันทึกไว้เป็นข้อจำกัดในการรับชม: การเข้าถึงระดับฟรีมีไว้เพื่อพิสูจน์ความเร็ว ไม่ใช่เพื่อเรียกใช้ปริมาณการใช้งานจริง
การยืดเวลาที่ไม่ว่างสำหรับโมเดลแบบเปิด
การเพิ่มดังกล่าวเกิดขึ้นในช่วงที่มีผู้คนหนาแน่นสำหรับ AI แบบเปิดน้ำหนัก IFM ห้องปฏิบัติการในสหรัฐอาหรับเอมิเรตส์เพิ่งเปิดตัว K2 Horizon ซึ่งเป็นกลุ่มอุปกรณ์ที่เชื่อมต่อกันซึ่งมีโมเดลแบบเปิดเต็มรูปแบบ 6 รุ่น และ Meta ยังคงทำซ้ำตระกูล Muse สำหรับการเขียนโค้ดและการใช้งานแบบเอเจนต์ ในขณะเดียวกัน ระบบนิเวศแบบเปิดในจีนยังคงจัดส่งในอัตราที่บีบรัดรอบการปล่อยทั่วทั้งอุตสาหกรรม
สำหรับนักพัฒนา สิ่งที่นำไปใช้ได้จริงก็คือสแต็กของโมเดลแบบเปิดกำลังเติบโตเต็มที่ในสองด้านพร้อมกัน ได้แก่ ความสามารถ เนื่องจากโมเดลขนาดกลางปิดช่องว่างด้วยการติดธงในงานประจำวัน และการให้บริการด้านเศรษฐศาสตร์ ในขณะที่ผู้ให้บริการอนุมานเฉพาะทางแข่งขันกันด้วยความเร็วดิบ Qwen 3.8 27B บน Cerebras เป็นจุดข้อมูลสำหรับทั้งสองเทรนด์ ซึ่งเป็นโมเดลแบบเปิดรุ่นปัจจุบันที่ให้บริการด้วยความเร็วที่แปลกใหม่เมื่อปีที่แล้ว บนฮาร์ดแวร์ที่สร้างขึ้นเพื่องานนี้โดยเฉพาะ
นักพัฒนาที่ประเมินแพลตฟอร์มควรเปรียบเทียบปริมาณงานของตนเอง ความเร็วที่เผยแพร่เป็นตัวเลขในแค็ตตาล็อก ปริมาณงานในโลกแห่งความเป็นจริงขึ้นอยู่กับความยาวที่แจ้ง การทำงานพร้อมกัน และการกำหนดค่า และขีดจำกัดอัตราของ Free Tier จะผูกมัดก่อนที่ความเร็วจะถึง
ก้าวนำหน้า AI
การเปิดตัวโมเดลทุกครั้ง การอัปเดตแพลตฟอร์มการอนุมาน และการเปิดตัวเครื่องมือสำหรับนักพัฒนา ติดตามเมื่อเกิดขึ้น — อ่านข่าว AI เพิ่มเติม →
