xAI ได้เปิดตัว Grok 4.7 ซึ่งเป็นโมเดลที่มีความสามารถมากที่สุดของบริษัทในด้านการเขียนโค้ดและการทำงานด้านความรู้ หลังจากการหยอกล้อในที่สาธารณะหลายสัปดาห์และเกิดความล่าช้าอย่างน้อยหนึ่งครั้ง ประกาศบนเว็บไซต์ของบริษัทเมื่อวันอาทิตย์ โมเดลดังกล่าวมีราคาเท่ากันและให้บริการความเร็วเหมือนกับ Grok 4.6 รุ่นก่อน: 2 ดอลลาร์ต่ออินพุตโทเค็น 1 ล้านรายการ และ 6 ดอลลาร์ต่อล้านเอาต์พุตโทเค็น ประมาณครึ่งหนึ่งของราคาปลีกของ GPT-5.6 Sol Max ของ OpenAI ($4/$20) และอยู่ภายใต้ Anthropic's Fable 5.1 Max ($10/$50)
หากต้องการทราบข่าวด่วนและการวิเคราะห์ AI ล่าสุด โปรดไปที่ AI Buzz Wire
โมเดลฐานที่ใหญ่ขึ้น ฝึกฝนสำหรับงานที่ยาวนาน
ตามประกาศของ xAI Grok 4.7 ใช้โมเดลพื้นฐานใหม่ที่ใหญ่กว่าเมื่อเทียบกับ Grok 4.6 และได้รับการฝึกอบรมด้วยการเรียนรู้แบบเสริมกำลังที่ยาวนานขึ้นโดยผสมผสานงานที่ยากขึ้น โดยถ่วงน้ำหนักให้กับปัญหาที่ใช้เวลาหลายชั่วโมงจึงจะเสร็จสมบูรณ์ บริษัทกล่าวว่าแบบจำลองนี้ดีกว่าในการตรวจสอบงานของตัวเองและจัดการบริบทที่ยาวขึ้น และได้รับการฝึกอบรมให้เข้าใจการควบคุม Grok Bot โดยกำเนิด ปรับปรุงงานสนทนาและงานความรู้ทั่วไป
การเปิดตัวเป็นไปตามการวิ่งที่มีเสียงดัง Elon Musk กล่าวครั้งแรกเมื่อต้นเดือนกันยายนว่า Grok 4.7 จะลงจอดภายในสิบวัน จากนั้นรับทราบในช่วงกลางเดือนกันยายนว่าโมเดลดังกล่าวต้องใช้เวลาปรับแต่งอีกสองสามวัน ตามข้อมูลจาก TeslaNorth.com ขณะนี้มีการจัดส่งแล้ว และ GitHub ยืนยันในวันเดียวกับที่ Grok 4.7 พร้อมใช้งานใน GitHub Copilot
ภาพ Benchmark แข็งแกร่ง ไม่กวาดล้าง
ข้อมูลเกณฑ์มาตรฐานที่เผยแพร่โดย xAI แสดงให้เห็นแบบจำลองที่เป็นผู้นำในประเภทขอบฟ้าไกลหลายประเภท ในขณะที่ยังตามหลังการกำหนดค่าที่แพงที่สุดของ Anthropic ในกลุ่มอื่นๆ:
- CursorBench 4.0 ซึ่งเน้นงานเขียนโค้ดที่ใช้เวลานานกว่า: Grok 4.7 ได้คะแนน 46.3% เหนือกว่า GPT-5.6 Sol Max (41.7%) และ Grok 4.6 High (40.4%) แต่ตามหลัง Fable 5.1 Max (51.8%)
- Terminal-Bench 4.0 งานเทอร์มินัลหลายชั่วโมง: 38.0% เพิ่มขึ้นอย่างรวดเร็วจาก 20.3% สำหรับ Grok 4.6 และเหนือกว่า GPT-5.6 Sol Max (37.3%) แม้ว่า Fable 5.1 Max จะเป็นผู้นำที่ 57.9%
- EEBench ซึ่งเป็นเกณฑ์มาตรฐานทางวิศวกรรมไฟฟ้า: 64.0% ซึ่งเพิ่มขึ้นอย่างมากจาก Grok 4.6 ที่ 53.0% และรุ่นสูงสุดที่ระบุไว้
- DeepSWE v1.1: 71.0% ที่ความพยายามสูง เทียบกับ 65.2% สำหรับ Grok 4.6 และ 72.7% สำหรับ GPT-5.6 Sol Max
- AA Briefcase v1.1 งานในสำนักงานหลายชั่วโมง: 1,657 เพิ่มขึ้นจาก 1,546 และปิดตามหลัง Fable 5.1 Max ที่ 1,678
- เกณฑ์มาตรฐานตัวแทนทางกฎหมายของ Harvey: 19.6% นำหน้า Grok 4.6 (15.8%) และนำหน้า GPT-5.6 Sol Max (2.5%) และ Fable 5.1 Max (6.7%) มากในการวัดนี้
- HealthBench Professional: 56.7% ปรับปรุงจาก Grok 4.6's 48.5% แต่ตามหลัง GPT-5.6 Sol Max (60.5%) และ Fable 5.1 Max (62.1%)
ใน GDPval ซึ่งเป็นเกณฑ์มาตรฐานการทำงานและความรู้ระดับมืออาชีพที่ Elo ทำคะแนน แผนภูมิของ xAI ทำให้ Grok 4.7 อยู่ที่ xhigh การใช้เหตุผลอยู่ที่ 1,695 เพิ่มขึ้นจาก 1,605 สำหรับ Grok 4.6 ตามหลัง Fable 5.1 Max (1,735) และเหนือกว่า GPT-6 Astra Max (1,542)
ราคาคือเรื่องราว
คำกล่าวอ้างที่ก้าวร้าวที่สุดในการประกาศนี้เป็นเรื่องทางเศรษฐกิจมากกว่าทางเทคนิค xAI อธิบายว่า Grok 4.7 เร็วกว่าสองเท่าในราคาครึ่งหนึ่งของรุ่นที่เทียบเคียงได้ และตารางราคาที่เผยแพร่สนับสนุนการเปรียบเทียบพาดหัวกับการกำหนดค่าระดับบนสุดของคู่แข่งหลักทั้งสองราย ราคาโทเค็น $2/$6 ของ Grok 4.7 ไม่มีการเปลี่ยนแปลงจาก Grok 4.6 ซึ่งหมายความว่าผู้ซื้อจะได้รับการปรับปรุงรุ่นต่อรุ่นโดยไม่ต้องขึ้นราคา
การวางตำแหน่งดังกล่าวเป็นการขยายกลยุทธ์ที่ xAI ได้ดำเนินการในกลุ่มผลิตภัณฑ์ Grok 4.x: จับคู่หรือเข้าถึงคุณภาพระดับแนวหน้าในขณะที่ตัดราคาระดับพรีเมี่ยมของ OpenAI และ Anthropic จากนั้นกระจายเชิงรุกผ่านพันธมิตร รวมถึง GitHub, Cursor และ OpenRouter
สิ่งที่ต้องดู
ข้อแม้ที่ตรงไปตรงมาคือ xAI เผยแพร่แผนภูมิเปรียบเทียบ และการตรวจสอบโดยอิสระจากผู้รวบรวมการเปรียบเทียบจะใช้เวลาหลายวัน สำหรับตัวเลขที่ xAI เลือกที่จะเน้นนั้น Grok 4.7 เป็นการก้าวขึ้นมาอย่างแท้จริงจาก Grok 4.6 — ซึ่งเห็นได้ชัดเจนที่สุดบน Terminal-Bench 4.0 และ EEBench — แต่มันไม่ได้กวาดล้าง Fable 5.1 Max ซึ่งยังคงรักษาความเป็นผู้นำในด้านการเข้ารหัสและการวัดประสิทธิภาพด้านสุขภาพ ในขณะที่มีราคาสูงกว่าห้าเท่าต่อโทเค็นเอาต์พุต
สำหรับนักพัฒนาที่ทำงานปริมาณงานตัวแทนนานหลายชั่วโมง การคำนวนประสิทธิภาพด้านราคาอาจมีความสำคัญมากกว่าอันดับกระดานผู้นำแบบดิบ Grok 4.7 พร้อมใช้งานแล้วผ่าน API ของ xAI และใน GitHub Copilot
ก้าวนำหน้า AI
หากต้องการรายงานข่าวการพัฒนาที่สำคัญที่สุดของอุตสาหกรรม AI อย่างต่อเนื่อง โปรดบุ๊กมาร์ก AI Buzz Wire และไม่พลาดเรื่องราวด่วน
อ่านข่าว AI เพิ่มเติม