Inception Labs เปิดตัว Mercury 2.5 เมื่อวันอังคาร ซึ่งเป็นเวอร์ชันใหม่ของโมเดลภาษาการแพร่กระจายเชิงพาณิชย์ที่บริษัทอธิบายว่าเป็น LLM การแพร่ที่มีความสามารถมากที่สุดในตลาด และเป็นโมเดลภาษาการแพร่กระจายที่ใหญ่ที่สุดเท่าที่เคยมีการฝึกฝนมา ตามประกาศของบริษัท โมเดลดังกล่าวมีความชาญฉลาดเพิ่มขึ้น 40% เมื่อเทียบกับรุ่นก่อนอย่าง Mercury 2 ในขณะที่ยังคงรักษาโปรไฟล์การให้บริการที่มีต้นทุนต่ำและมีความหน่วงต่ำเหมือนเดิม ซึ่งทำให้สถาปัตยกรรมการแพร่กระจายน่าดึงดูดสำหรับเวิร์กโหลดที่มีปริมาณมาก

บริษัท นำโดย CEO Stefano Ermon อ้างว่า Mercury 2.5 เทียบได้กับรุ่นชายแดนที่มีการเพิ่มประสิทธิภาพด้านต้นทุน เช่น GPT-5.6 Luna (Low), Gemini 3.5 Flash-Lite และ Claude Haiku 4.5 การเปรียบเทียบเหล่านี้ได้รับการรายงานจากผู้จำหน่ายและยังไม่ได้รับการตรวจสอบโดยเกณฑ์มาตรฐานที่เป็นอิสระ แต่วางตำแหน่งแบบจำลองการแพร่กระจายซึ่งเป็นเรื่องที่อยากรู้อยากเห็นในการวิจัยมายาวนาน เป็นทางเลือกในการผลิตแทนผู้ครอบครองตลาดที่ถดถอยอัตโนมัติ สำหรับข่าวสารโมเดล AI ล่าสุด โปรดติดตามการรายงานข่าวโมเดลอย่างต่อเนื่องของ AI Buzz Wire ข่าวโมเดล AI ล่าสุด

ความเร็ว บริบท และราคา

ตัวเลขพาดหัวมีความก้าวร้าว Inception Labs กล่าวว่า Mercury 2.5 สร้าง 1,107 โทเค็นต่อวินาทีบน NVIDIA GPU ที่มีจำหน่ายทั่วไป โดยมีหน้าต่างบริบท 260,000 โทเค็น ราคาตั้งไว้ที่ 0.20 เหรียญสหรัฐต่อล้านอินพุตโทเค็น และ 0.75 ดอลลาร์ต่อโทเค็นเอาท์พุต โดยมีโปรโมชั่นการเปิดตัวลดราคาโมเดล 80% เหลือ 0.04 ดอลลาร์ต่อล้านอินพุตและ 0.15 ดอลลาร์ต่อล้านเอาต์พุต

ในด้านความสามารถ โมเดลมาพร้อมกับการให้เหตุผลแบบปรับได้ — ช่วยให้นักพัฒนาแลกเปลี่ยนเวลาแฝงสำหรับความลึกตามคำขอ — พร้อมด้วยการเรียกเครื่องมือแบบขนานและเอาต์พุต JSON ที่สอดคล้องกับสคีมาสำหรับการสร้างแบบมีโครงสร้าง บริษัทกำหนดการเปิดตัวการเปิดตัวเป็นผลแรกของวงจรการฝึกอบรมที่ขับเคลื่อนโดยการวัดและส่งข้อมูลทางไกลในการผลิต: นับตั้งแต่เปิดตัว Mercury 2 นักพัฒนาหลายพันคนได้ใช้มัน องค์กรหลายสิบแห่งได้ใช้งานมัน และการใช้งานก็เติบโตขึ้นมากกว่าลำดับความสำคัญ

เหตุใดโมเดลการแพร่กระจายจึงสร้างข้อความได้เร็วขึ้น

LLM กระแสหลักจาก OpenAI, Google และ Anthropic เป็นแบบถดถอยอัตโนมัติ โดยจะสร้างข้อความทีละโทเค็น โดยแต่ละโทเค็นมีเงื่อนไขกับทุกสิ่งที่สร้างขึ้นก่อนหน้านั้น การพึ่งพาตามลำดับนั้นทำให้พื้นแข็งภายใต้ความเร็วการสร้าง โมเดลภาษาการแพร่กระจายจะเริ่มต้นด้วยบล็อกสัญญาณรบกวนและปรับแต่งโทเค็นทั้งหมดซ้ำ ๆ แบบขนาน ซึ่งช่วยให้สามารถรับส่งข้อมูลได้มากขึ้นบนฮาร์ดแวร์ GPU ทั่วไปเมื่อโมเดลได้รับการฝึกฝนให้มาบรรจบกันอย่างหมดจด

การแลกเปลี่ยนนั้นมีคุณภาพในอดีต: โมเดลการแพร่กระจายได้ติดตามโมเดลการถดถอยอัตโนมัติในด้านการใช้เหตุผลและเกณฑ์มาตรฐานตามคำสั่ง เดิมพันหลักของ Inception Labs และการอ้างสิทธิ์ที่เกี่ยวข้องกับ Mercury 2.5 คือช่องว่างนี้แคบลงจนถึงจุดที่การแพร่กระจายชนะบนแกนที่ลูกค้าส่วนใหญ่รู้สึกได้จริง นั่นคือ เวลาแฝงและต้นทุนตามปริมาณการผลิต

การเรียกร้องการผลิตจากลูกค้ารายแรก

การประกาศดังกล่าวเน้นไปที่การใช้งานของลูกค้ามากกว่าตารางเปรียบเทียบ OpenCall ซึ่งสร้างตัวแทนโทรศัพท์ AI สำหรับการโทรสดของลูกค้า รายงานว่าการย้ายไปใช้ Mercury ทำให้ค่ามัธยฐานของเวลาแฝงในการตอบสนองของโมเดลอยู่ที่ประมาณ 170 มิลลิวินาที Oliver Silverstein ผู้ร่วมก่อตั้งและซีอีโอของ OpenCall กล่าวว่าเวลาตอบสนอง P99 ของบริษัทลดลงจากหลายนาทีเหลือหนึ่งวินาที และค่ามัธยฐานจาก 0.4 วินาทีเหลือต่ำกว่า 0.2 ซึ่งเป็นตัวเลขที่เขาอธิบายว่าเร็วกว่าผู้ให้บริการรายอื่นที่บริษัททดสอบอย่างมาก รวมถึงเปิดใช้งานการให้เหตุผลด้วย

Augment Code ซึ่งเป็นผู้ช่วยผู้สร้างโค้ด AI ใช้ Mercury สำหรับการกระชับบริบท การกำหนดเส้นทางโมเดล และการค้นหาเครื่องมือ MCP จากข้อมูลของ Inception Labs การย้ายปริมาณงานการบดอัดไปยัง Mercury ลดเวลาแฝงของขั้นตอนนั้นลง 82% จากประมาณ 150 วินาทีเหลือ 27 วินาที และลดต้นทุนลง 90% ในขณะที่ยังคงคุณภาพไว้ กรณีการใช้งานแสดงให้เห็นว่าเศรษฐกิจกัดจุดใด: เอเจนต์การเขียนโค้ดทำการเรียกโมเดลสนับสนุนเล็กๆ น้อยๆ จำนวนมากในแต่ละรุ่นหลักแต่ละรุ่น และรวมเวลาแฝงและต้นทุนในการเรียกเหล่านั้น

NVIDIA ซึ่งมีฮาร์ดแวร์ที่ใช้โมเดลดังกล่าวก็ชั่งน้ำหนักเช่นกัน Shruti Koparkar ผู้จัดการอาวุโสของผลิตภัณฑ์ในกลุ่ม Accelerated Computing ของ NVIDIA กล่าวว่า Inception มีโมเดลภาษาที่อิงการแพร่กระจายขั้นสูงบนโครงสร้างพื้นฐาน NVIDIA AI และการปรับปรุงคุณภาพของ Mercury 2.5 ด้วยความเร็วที่ยั่งยืนแสดงให้เห็นว่าสถาปัตยกรรมใหม่สามารถพัฒนาไปสู่ระบบที่พร้อมสำหรับการผลิตได้อย่างรวดเร็วเพียงใด

ตัวอย่าง Mercury Voice และ Mercury Router

นอกจากโมเดลดังกล่าวแล้ว Inception Labs ยังประกาศตัวอย่างผลิตภัณฑ์ใหม่ 2 รายการอีกด้วย Mercury Voice เป็น LLM แบบแพร่กระจายที่ได้รับการปรับให้เหมาะสมสำหรับตัวแทนเสียงที่มีงบประมาณเวลาแฝงที่จำกัดที่สุด เวลาในการโฆษณาถึงโทเค็นแรกต่ำกว่า 170 มิลลิวินาที Mercury Router ใช้โมเดลการแพร่กระจายเพื่อทำความเข้าใจข้อความแจ้งที่เข้ามา และกำหนดเส้นทางไปยังรุ่นใดก็ตาม ไม่ว่าจะเปิดหรือปิด นำเสนอการผสมผสานคุณภาพ ความเร็ว และต้นทุนที่ดีที่สุด โดยวางตำแหน่ง Inception ให้เป็นเลเยอร์เหนือคู่แข่งและเป็นหนึ่งในนั้น

Mercury 2.5 มีให้บริการผ่าน API ของ Inception รวมถึงผ่าน Baseten และ OpenRouter การใช้งานระดับองค์กรจะเพิ่มความจุเฉพาะ การปรับขนาดอัตโนมัติ การควบคุมการปฏิบัติตามข้อกำหนด และการเก็บรักษาข้อมูลที่กำหนดค่าได้ บริษัทเสนอโทเค็นฟรี 100 ล้านโทเค็นให้กับนักพัฒนาที่ลองใช้ API

บริษัทยังกล่าวอีกว่าได้เริ่มฝึกอบรมรุ่นถัดไปแล้ว ซึ่งมีขนาดใหญ่ที่สุดโดยมีเป้าหมายสำหรับการเปิดตัวในอีกไม่กี่เดือนข้างหน้า ซึ่งอธิบายว่าเป็นการก้าวกระโดดในความสามารถที่ไม่ทำให้ความเร็วของการแพร่กระจายหรือประสิทธิภาพของโทเค็นลดลง หากการกล่าวอ้างดังกล่าวยังคงอยู่ ความกดดันต่อผู้ครอบครองตลาดที่ถดถอยอัตโนมัติจะรู้สึกเป็นอันดับแรกในระดับสินค้าโภคภัณฑ์ของตลาด ซึ่งราคาและเวลาแฝงจะตัดสินสัญญาส่วนใหญ่

ก้าวนำหน้า AI

ติดตามการพัฒนา AI ล่าสุดและข่าวด่วนเกี่ยวกับปัญญาประดิษฐ์เมื่อสถาปัตยกรรมโมเดลใหม่แข่งขันกันในการผลิต

อ่านข่าว AI เพิ่มเติม →