บริษัททำการเปรียบเทียบ Artificial Analysis เปิดตัวเวอร์ชัน 4.2 ของ Intelligence Index เมื่อวันที่ 4 กันยายน 2026 ซึ่งเป็นการอัปเดตชั่วคราวที่ปรับปรุงวิธีการวัดโมเดล AI ระดับแนวหน้า และตามกระดานผู้นำใหม่ Claude Fable 5.1 ของ Anthropic ครองตำแหน่งสูงสุด โดยมี GPT-6 Astra ของ OpenAI อยู่ในอันดับที่สอง หลังจากได้คะแนนเพิ่มขึ้น 4 แต้มเหนือ GPT-5.6 Sol
การอัปเดตนี้เกิดขึ้นเพียงแปดเดือนหลังจาก Index v4 เปิดตัวในเดือนมกราคม ซึ่งเป็นการพลิกกลับที่รวดเร็วผิดปกติของบริษัทเนื่องมาจากการเผยแพร่ขอบเขตล่าสุด “ด้วยขอบเขตที่เคลื่อนตัวอย่างรวดเร็วในช่วงสัปดาห์ที่ผ่านมา เรารู้สึกว่าเป็นสิ่งสำคัญที่จะต้องส่งการอัปเดตชั่วคราวทันทีเพื่อให้แน่ใจว่าดัชนีของเรายังคงมีความเกี่ยวข้องและมีประโยชน์เช่นเคย” บริษัทเขียนไว้ในประกาศ
อันดับพาดหัวข่าว
จากผลการเผยแพร่ Claude Fable 5.1 ของ Anthropic เป็นผู้นำในดัชนี ตามมาด้วย GPT-6 Astra ของ OpenAI ซึ่งพัฒนาขึ้นสี่คะแนนเหนือ GPT-5.6 Sol Meta ได้รับการจัดอันดับให้เป็นห้องทดลองที่แข็งแกร่งเป็นอันดับสามในลีดเดอร์บอร์ด ตามมาด้วย SpaceXAI, Moonshot/Kimi, Z.AI และ Google
Anthropic และ OpenAI ยังแบ่งปันรูปภาพความคุ้มค่าที่อัปเดต: ทั้งสองบริษัท พร้อมด้วย Meta และ Z.AI ครอบครองขอบเขต Pareto "ต้นทุนต่องาน" ของดัชนี ซึ่งหมายความว่าปัจจุบันไม่มีห้องปฏิบัติการอื่นใดที่นำเสนอข่าวกรองที่ดีกว่าอย่างเคร่งครัดในราคาเดียวกันต่องานที่เสร็จสมบูรณ์
ในด้านประสิทธิภาพของโทเค็น การวิเคราะห์เชิงประดิษฐ์พบว่า GPT-6 Astra "โทเค็นมีประสิทธิภาพมากกว่าโมเดลอื่นๆ เกือบทุกรุ่นที่อยู่ใกล้ขอบเขตข่าวกรอง" โดยมี Claude Fable 5.1, Grok 4.5 และ Gemini 3.5 Flash-Lite อยู่ที่ปลายทั้งสองด้านของเส้นโค้ง อย่างไรก็ตาม บริษัทตั้งข้อสังเกตในการวิเคราะห์ร่วมว่าการใช้โทเค็นที่ต่ำกว่าของ Astra นั้นมีน้ำหนักมากกว่าราคาที่สูงกว่า ซึ่งเป็นเครื่องเตือนใจว่าประสิทธิภาพโดยรวมและต้นทุนทั้งหมดไม่ได้เคลื่อนไหวร่วมกันเสมอไป
สิ่งที่เปลี่ยนแปลงไปในเวอร์ชัน 4.2
การเปลี่ยนแปลงโครงสร้างที่สำคัญที่สุดคือการจงใจผลักดันการเล่นเกมมาตรฐาน สี่สิบเปอร์เซ็นต์ของการถ่วงน้ำหนักของดัชนีในขณะนี้มาจากชุดการทดสอบแบบส่วนตัวที่จัดขึ้นโดยเฉพาะ ซึ่งมีส่วนแบ่งเป็นสองเท่าในเวอร์ชัน 4.1 รวมถึง AA-Briefcase, AA-Omniscience และโซลูชันสำหรับ CritPt บริษัทกล่าวว่าตัวเลขดังกล่าวจะเพิ่มขึ้นอีกในดัชนี v5
การประเมินใหม่สองรายการถือเป็นการอัปเดต:
- AA-Briefcase ซึ่งเป็นเกณฑ์มาตรฐานการทำงานด้านความรู้เชิงตัวแทนภายในองค์กรพร้อมชุดทดสอบส่วนตัว แบบจำลองจะได้รับการประเมินในโครงการมืออาชีพหลายสัปดาห์ โดยแต่ละโครงการมีงานที่เชื่อมโยงกันจำนวนมากและไฟล์ต้นฉบับอินพุตหลายพันรายการ และให้คะแนนโดยใช้การผสมผสานของการให้คะแนนตามรูบริกและการเปรียบเทียบแบบคู่ ซึ่งครอบคลุมความสำเร็จของงานที่ตรวจสอบได้ คุณภาพการวิเคราะห์ และคุณภาพการนำเสนอ
- GDP.pdf สร้างโดย Surge AI ซึ่งทดสอบการให้เหตุผลแบบครบวงจรในเอกสารระดับมืออาชีพ: PDF 100 ไฟล์ครอบคลุม 10 โดเมน โดยมีหลักฐานกระจายอยู่ในข้อความ ตาราง แผนภูมิ และเชิงอรรถ 4,592 หน้า คำตอบจะถูกให้คะแนนตามเกณฑ์อะตอมมิกที่เขียนโดยผู้เชี่ยวชาญ 1,275 รายการ และหัวข้อข่าว อัตราการผ่านทั้งหมด จะให้เครดิตงานก็ต่อเมื่อทุกเกณฑ์ได้รับการตอบสนองเท่านั้น
มาตรฐานที่มีมาอย่างยาวนานกำลังจะหมดลง: GPQA Diamond ซึ่งเป็นการทดสอบการใช้เหตุผลทางวิทยาศาสตร์ระดับบัณฑิตศึกษาได้ถูกลบออกไปแล้ว เนื่องจากได้รับความอิ่มตัวอย่างมีประสิทธิภาพจากแบบจำลองระดับแนวหน้า
นอกจากนี้ บริษัทยังได้อัปเกรดโครงสร้างพื้นฐานในการให้คะแนน โดยปล่อย AA-LCR v1.1 พร้อมระบบการให้เกรดใหม่และปุ่มคำตอบที่แก้ไขแล้ว การยึดสเกล Elo สำหรับ GDPval-AA v2 และ AA-Briefcase อีกครั้ง เพื่อให้การให้คะแนนคงที่เมื่อมีโมเดลใหม่ๆ เข้ามา และทำให้แซนด์บ็อกซ์การให้เกรดของ SciCode แข็งแกร่งขึ้น เพื่อให้โค้ดที่ช้าแต่ถูกต้องไม่นับเป็นความล้มเหลวอีกต่อไป
สิ่งที่การทดสอบใหม่เปิดเผย
ผลลัพธ์จากการประเมินครั้งใหม่ทำให้เห็นภาพที่ละเอียดมากขึ้นว่าห้องปฏิบัติการชายแดนตั้งอยู่ตรงไหน
ใน AA-Briefcase, Claude Fable 5.1 และ Opus 5 ของ Anthropic เป็นผู้นำ ตามมาด้วย GPT-6 Astra ของ OpenAI และ Muse Spark 1.3 ของ Meta GPT-6 Astra ได้คะแนน Elo ประมาณ 85 คะแนน ซึ่งสูงกว่า GPT-5.6 Sol ในการประเมินเดียวกัน ซึ่งเป็นการก้าวกระโดดอย่างมากระหว่าง OpenAI รุ่นต่อๆ ไป
ใน GDP.pdf รูปภาพจะพลิกกลับ: OpenAI ขึ้นนำด้วย GPT-6 Astra ที่ 33.2% All-pass Rate ตามด้วย GPT-5.6 Sol ที่ 28.2% และ Claude Fable 5.1 ที่ 26.2% ความแตกต่างดังกล่าวชี้ให้เห็นว่าการสังเคราะห์เอกสารขนาดยาวเหนือบริบทที่มีขนาดใหญ่มากยังคงเป็นจุดแข็งของโมเดลใหม่ล่าสุดของ OpenAI แม้ว่าโมเดลของ Anthropic จะเป็นผู้นำในด้านดัชนีโดยรวมและงานด้านตัวแทนก็ตาม
เหตุใดชุดการทดสอบส่วนตัวจึงมีความสำคัญ
การเปลี่ยนแปลงไปสู่การประเมินแบบระงับสะท้อนให้เห็นถึงปัญหาความน่าเชื่อถือที่กว้างขึ้นในการเปรียบเทียบ AI เนื่องจากแบบจำลองได้ดูดซับข้อมูลการทดสอบสาธารณะมากขึ้น ห้องปฏิบัติการและผู้สังเกตการณ์อิสระจึงมีความกังวลมากขึ้นว่าคะแนนพาดหัวเกี่ยวกับเกณฑ์มาตรฐานที่รู้จักกันดีจะสะท้อนถึงการท่องจำหรือการฝึกอบรมแบบกำหนดเป้าหมายมากกว่าความสามารถที่แท้จริง ด้วยการรักษาส่วนแบ่งที่เพิ่มขึ้นของชุดการทดสอบให้เป็นส่วนตัวและให้น้ำหนักมากขึ้น การวิเคราะห์ประดิษฐ์กำลังพยายามรักษาสัญญาณที่แสดงว่าบอร์ดผู้นำสาธารณะสูญเสียไป
บริษัทกล่าวว่ากำลังสร้างองค์ประกอบของ Index v5 "เป็นเวลาหลายเดือน" และจงใจระงับการอัปเดตเพื่อให้ดัชนีมีเสถียรภาพผ่านการเปิดตัวโมเดลหลักๆ จำนวนมากเมื่อเร็วๆ นี้ นอกเหนือจากการเปิดตัวเวอร์ชัน 4.2 ชั่วคราวแล้ว ยังมีการวางแผนการอัปเดตเพิ่มเติมในอนาคตอันใกล้นี้เมื่อการเปลี่ยนแปลงเวอร์ชัน 5 เสร็จสมบูรณ์
สำหรับผู้ซื้อที่เลือกระหว่างรุ่นชายแดน สิ่งที่นำไปใช้ได้จริงจากเวอร์ชัน 4.2 ก็คือ จุดสูงสุดของตลาดยังคงเป็นการแข่งขันแบบสองม้าระหว่าง Anthropic และ OpenAI โดยที่ Meta ปิดช่องว่าง — และการประเมินที่ออกแบบมาให้ทนทานต่อการเล่นเกมกำลังทำหน้าที่จัดอันดับมากขึ้น ผู้ใช้ที่ติดตามการตัดสินใจเลือกโมเดลสามารถติดตามการพัฒนา AI ล่าสุดเมื่อใกล้เปิดตัว v5
ก้าวนำหน้า AI
การอัปเดตเกณฑ์มาตรฐานเช่นนี้จะกำหนดรูปแบบใหม่ของอุตสาหกรรมที่ตัดสินความก้าวหน้า อ่านข่าว AI เพิ่มเติม และนำหน้าการเปิดตัวโมเดลทุกรุ่น
อ่านข่าว AI เพิ่มเติม →