Multiverse Computing บริษัท AI ในยุโรปได้เปิดตัว Quasar 438B ซึ่งเป็นโมเดลการให้เหตุผลขนาดใหญ่ที่บริษัทกล่าวว่าเป็นโมเดล AI ที่ฉลาดที่สุดที่สร้างขึ้นในยุโรป ตามประกาศของบริษัท Quasar 438B ได้คะแนน 43 ในดัชนี Artificial Analysis Intelligence ซึ่งเป็นผลลัพธ์สูงสุดในบรรดาโมเดลในยุโรปที่วัดด้วยเกณฑ์มาตรฐานนั้น
การเปิดตัวครั้งนี้ถือเป็นก้าวสำคัญสำหรับบริษัทในสเปน ซึ่งสร้างชื่อเสียงในด้านการบีบอัดโมเดล AI มากกว่าการฝึกอบรมระบบระดับแนวหน้า Quasar 438B เป็น Multiverse Computing รุ่นใหญ่รุ่นแรกที่เปิดตัว และมาถึงในขณะที่รัฐบาลและบริษัทต่างๆ ในยุโรปผลักดันขีดความสามารถด้าน AI ที่ไม่ได้ขึ้นอยู่กับห้องปฏิบัติการของอเมริกาและจีนทั้งหมด สำหรับผู้อ่านที่ติดตามการรายงานข่าว AI ของเรา การเผยแพร่ยังส่งสัญญาณว่าการแข่งขันเพื่อปิดช่องว่างด้วยโมเดลชายแดนไม่ได้จำกัดอยู่เพียงผู้เข้าแข่งขันตามปกติในสหรัฐฯ อีกต่อไป
สิ่งที่ Quasar 438B ทำคะแนนได้จริง
Artificial Analysis Intelligence Index (เวอร์ชัน 4.1.1) รวมการประเมินเก้ารายการ รวมถึง GDPval-AA v2, tau3-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience และ AA-LCR คะแนนรวมของ Quasar 438B ที่ 43 คะแนน นำหน้า Mistral Medium 3.5 ที่ 30 คะแนน, Nemotron 3 Ultra ของ NVIDIA ที่ 38 คะแนน และ Inkling ที่ 42 ตามประกาศของบริษัท
เขตข้อมูลที่กว้างขึ้นยังคงเป็นของเขตแดนอเมริกา: Claude Opus 5 เป็นผู้นำดัชนีที่ 63 Multiverse Computing ไม่ได้อ้างสิทธิ์เป็นอย่างอื่น แต่บริษัทกลับมองว่า Quasar 438B เป็นตัวเลือกที่แข็งแกร่งที่สุดของยุโรป โดยเหนือกว่ารุ่นยุโรปที่เทียบเคียงได้ในการประเมินการวิเคราะห์ประดิษฐ์ 7 ใน 8 รายการที่เลือกไว้
ความเร็วเป็นข้อโต้แย้งที่สอง
คะแนนมาตรฐานดิบเป็นเพียงครึ่งหนึ่งของการนำเสนอของ Multiverse Computing บริษัทกล่าวว่า Quasar 438B ส่งคืน 500 โทเค็น รวมเวลาในการคิดใน 15.3 วินาที ในบรรดารุ่นที่เปรียบเทียบ มีเพียง Nemotron 3.5 Lightning (9.4 วินาที), Gemini 3.5 Flash-Lite (10.8 วินาที) และ Gemini 3.7 Flash (11.5 วินาที) เท่านั้นที่เร็วกว่า และมีเพียง Gemini 3.7 Flash เท่านั้นที่เร็วกว่าและมีความสามารถมากกว่าในดัชนี
การเปรียบเทียบกับ Mistral Medium 3.5 ดำเนินการทางเดียวในทั้งสองแกน: Quasar มีคะแนนสูงกว่า (43 ต่อ 30) และตอบเร็วกว่า (15.3 วินาทีต่อ 18.8 วินาที) Inkling ซึ่งเกือบจะตรงกับความฉลาดของ Quasar ที่ 42 นั้นต้องใช้เวลา 48.3 วินาทีสำหรับการตอบสนอง 500 โทเค็นเท่าเดิม ซึ่งนานกว่าสามเท่า
การใช้เหตุผลตามบริบทแบบยาวที่แข็งแกร่ง
ผลลัพธ์หนึ่งที่โดดเด่นจากการประกาศ: สำหรับ AA-LCR การประเมินที่ทดสอบความสามารถในการดึงข้อมูล เชื่อมโยง และให้เหตุผลกับข้อมูลที่กระจายอยู่ในเอกสารขนาดยาว Quasar 438B ได้คะแนน 75.0 นั่นคือระดับเดียวกับ Grok 4.6 (สูง) ภายในจุดของ Claude Opus 5 ที่ 75.7 และเหนือกว่า Qwen3.8 2.4T A95B ที่ 75.3 ตามตัวเลขของบริษัท
การจัดการกับบริบทที่ยาวนานมีความสำคัญเนื่องจากมีการสร้างการวิจัยระดับองค์กร การวิเคราะห์เอกสาร และเวิร์กโฟลว์ตัวแทน หากโมเดลไม่สามารถเก็บและเชื่อมต่อข้อมูลในเอกสารขนาดยาวได้ ก็จะไม่สามารถขับเคลื่อนเครื่องมือหลายขั้นตอนที่บริษัทต้องการปรับใช้จริงได้ นี่คือจุดที่ควาซาร์เข้าใกล้กลุ่มชายแดนมากที่สุด
การเข้ารหัสแบบตัวแทนยังคงมีเหลืออยู่
ผลลัพธ์ที่อ่อนแอที่สุดในการประกาศคือ Terminal-Bench v2.1 ซึ่งทำให้เอเจนต์การเขียนโค้ดทำงานในสภาพแวดล้อมเทอร์มินัลจริง Quasar 438B ได้คะแนน 69.3 คะแนน นำ Mistral Medium 3.5 คะแนน 18.7 คะแนน และ Nemotron 3 Ultra 15.4 คะแนน แต่ตามหลังกลุ่มชายแดนนำโดย Claude Opus 5 ที่ 89.1 คะแนน Multiverse Computing ยอมรับว่านี่คือการประเมินที่มีพื้นที่ว่างมากที่สุด และกล่าวว่าการทำงานรอบถัดไปมุ่งเป้าไปที่การประเมินดังกล่าว
สร้างขึ้นสำหรับตัวแทนระดับองค์กร
Quasar 438B ถือเป็นต้นแบบสำหรับองค์กรที่เรียกใช้ตัวแทนพัฒนาซอฟต์แวร์ นักบินทางเทคนิค ระบบการวิจัย และระบบเวิร์กโฟลว์อัตโนมัติ โดยอยู่ในคลาสที่มีพารามิเตอร์มากกว่า 400 พันล้านพารามิเตอร์ รองรับภาษาอังกฤษและสเปน และได้รับการออกแบบสำหรับงานหลายขั้นตอนที่จำเป็นต้องมีการวางแผน การใช้เครื่องมือ การเรียกใช้โค้ด และบริบทขนาดใหญ่โดยไม่มีเวลาแฝงที่คลาสปกติมี
การเข้าถึงดำเนินการผ่าน CompactifAI API ของบริษัท ดังนั้นทีมจึงสามารถทดสอบโมเดลได้โดยไม่ต้องมีโครงสร้างพื้นฐานของตนเอง Multiverse Computing กล่าวว่าการอัปเดตเพิ่มเติมสำหรับ Quasar กำลังจะมา
ความหมายสำหรับการแข่งขัน AI ของยุโรป
การเปิดตัวเกิดขึ้นในช่วงเวลาที่แปลกประหลาดสำหรับ AI ของยุโรป Mistral ซึ่งเป็นผู้ถือมาตรฐานของทวีปมาอย่างยาวนาน ต้องเผชิญกับคำถามเกี่ยวกับทิศทางของมัน ในขณะที่ห้องปฏิบัติการของสหรัฐฯ ได้รวบรวมความเป็นผู้นำในด้านการวัดประสิทธิภาพแบบรวม แบบจำลองของยุโรปที่เป็นผู้นำในด้านดัชนีอิสระของยุโรปอย่างถูกต้องตามกฎหมาย ช่วยให้องค์กรต่างๆ ในทวีปนี้มีตัวเลือกระดับภูมิภาคที่น่าเชื่อถือ โดยเฉพาะอย่างยิ่งสำหรับการใช้งานสองภาษาระหว่างอังกฤษและสเปน
ไม่ว่า Quasar 438B จะดำรงตำแหน่งนั้นหรือไม่นั้นเป็นอีกเรื่องหนึ่ง บริษัทตั้งข้อสังเกตว่ามีผู้นำดัชนีเพียงเศษเสี้ยวเท่านั้นที่ตอบเร็วกว่า และช่องว่างของ Claude Opus 5 ยังคงมีความกว้างยี่สิบจุด แต่บริษัทที่เน้นการบีบอัดเป็นหลักได้แสดงให้เห็นว่าสามารถแข่งขันในระดับเฮฟวี่เวทได้ และในที่สุดบริษัทต่างๆ ในยุโรปก็มีโมเดลตลาดในประเทศที่คุ้มค่ากับการเปรียบเทียบกับการผิดนัดชำระหนี้ในสหรัฐฯ
ก้าวนำหน้า AI
ภูมิทัศน์ของ AI เปลี่ยนไปทุกชั่วโมง และโอกาสในการขายที่เป็นมาตรฐานซึ่งดูไม่สามารถเข้าถึงได้ในเดือนมกราคมจะหายไปในช่วงฤดูร้อน อ่านข่าว AI เพิ่มเติมบน AI Buzz Wire เพื่อติดตามการเปิดตัวโมเดลทุกรุ่น ผลลัพธ์การวัดประสิทธิภาพ และการเปลี่ยนแปลงนโยบายที่เกิดขึ้น
ติดตามการพัฒนา AI ล่าสุดได้ที่นี่