Reflection AI ซึ่งเป็นสตาร์ทอัพในอเมริกาที่ได้รับการสนับสนุนจาก Nvidia ได้เปิดตัวโมเดล open-weight รุ่นแรกเมื่อวันที่ 5 ตุลาคม ซึ่งเป็นระบบผู้เชี่ยวชาญแบบผสมเบาบางที่เรียกว่า Beam ซึ่งบริษัทวางตำแหน่งให้เป็นความท้าทายแบบตะวันตกที่แข็งแกร่งที่สุดสำหรับขอบเขตแบบ open-weight ที่ปัจจุบันถูกครอบงำโดยห้องปฏิบัติการของจีน การประกาศดังกล่าวเผยแพร่ในบล็อกของ Reflection และได้รับเลือกอย่างรวดเร็วโดย Reuters, TechCrunch, Fortune และ Semafor มาถึงจุดเปลี่ยน: โมเดลนี้ยังไม่สามารถดาวน์โหลดได้

บีมกำลังดำเนินการตามที่บริษัทอธิบายว่าเป็นการจัดทีมสีแดงและการประเมินผลขั้นสุดท้าย การเข้าถึงก่อนเปิดตัวนั้นเปิดผ่านขั้นตอนการลงทะเบียน และ Reflection กล่าวว่าจะปล่อยน้ำหนัก รายงานทางเทคนิค การ์ดโมเดล และสิ่งประดิษฐ์ของนักพัฒนาในปลายเดือนนี้ เมื่อสิ่งนั้นเกิดขึ้น Beam จะกลายเป็นหนึ่งในรุ่น open-weight ที่ใหญ่ที่สุดที่เคยเผยแพร่โดยห้องปฏิบัติการของสหรัฐอเมริกา และเป็นการทดสอบที่ชัดเจนที่สุดว่าบริษัทในอเมริกาสามารถจับคู่จังหวะการเปิดตัวและความเปิดกว้างได้หรือไม่ ซึ่งทำให้โมเดลจีนเป็นตัวเลือกเริ่มต้นสำหรับชุมชนโอเพ่นซอร์สส่วนใหญ่ หากต้องการรายงานข่าวการแข่งขันแบบโอเพ่นเวทอย่างต่อเนื่องและทุกสิ่งที่เคลื่อนไหวในสนาม โปรดบุ๊กมาร์กหน้าแรกข่าว AI ของเรา

ตัวเลขเบื้องหลังบีม

Beam เป็นโมเดลที่ผสมผสานระหว่างผู้เชี่ยวชาญไม่มาก โดยมีพารามิเตอร์ทั้งหมด 501 พันล้านพารามิเตอร์ โดยในจำนวนนี้มีการใช้งานประมาณ 23 พันล้านรายการต่อโทเค็น Reflection กล่าวว่าได้ฝึกโมเดลไว้ล่วงหน้าบนโทเค็น 23.8 ล้านล้านที่ดึงมาจากเว็บและชุดข้อมูลที่ได้รับอนุญาตที่เป็นกรรมสิทธิ์ โดยอ้างว่าโมเดลพื้นฐานตรงกันหรือมีประสิทธิภาพดีกว่าโมเดลฐานเปิดที่มีขนาดใกล้เคียงกัน

ข้อกล่าวอ้างที่โดดเด่นกว่านั้นเกี่ยวข้องกับการเรียนรู้แบบเสริมกำลัง Reflection ได้สร้างอัลกอริธึม สภาพแวดล้อมการฝึกอบรม และโครงสร้างพื้นฐานเพื่อรักษา RL ที่มีการประมวลผลสูงในวงกว้าง และบริษัทรายงานว่าการทำงานของ RL ได้สร้างการเปิดตัวมากกว่า 100 ล้านครั้งใน NVIDIA GB300 GPU จำนวน 10,500 ตัวในช่วงการฝึกอบรมสี่สัปดาห์ นั่นเป็นการลงทุน RL ที่มากผิดปกติสำหรับรุ่น open-weight และ Reflection ให้เครดิตสำหรับประสิทธิภาพการแข่งขันของ Beam ด้วยสิ่งที่เรียกว่าประสิทธิภาพการประมวลผลการอนุมานระดับแนวหน้า

เกณฑ์มาตรฐาน: แข่งขันได้ ยังไม่เป็นผู้นำ

ตารางเกณฑ์มาตรฐานที่เผยแพร่โดย Reflection ทำให้ Beam อยู่ในกลุ่ม open-weight อย่างมั่นคง ตามหลังโมเดลจีนที่ใหญ่ที่สุด แต่นำหน้าหรือระดับที่มีชื่อเป็นที่ยอมรับหลายชื่อ

ใน SWE-Bench Pro v2-Hard นั้น Beam ได้คะแนน 77.2 ตามหลัง GLM 5.3 ที่ 88.2 และ Kimi K3 ที่ 88.2 ในแถวเดียวกัน แต่เหนือกว่า Inkling ที่ 56.9 บน SWE-Bench Pro v1 นั้น Beam ได้คะแนน 65.5 นำหน้า Inkling (54.3), Nemotron 3 Ultra (46.4) และ GLM 5.2 (62.1) ในขณะที่ Qwen 3.8-Max โพสต์ 67.7 ในเกณฑ์มาตรฐานการเข้ารหัสเอเจนต์ DeepSWE v1.1 นั้น Beam บันทึก 44.4 ระดับเดียวกับ GLM 5.2's 44.0 และตามหลัง GLM 5.3 (61.0), Qwen 3.8-Max (51.0) และ DeepSeek V4.1 Flash (74.2)

การวางกรอบของบริษัทนั้นตรงไปตรงมาเกี่ยวกับตำแหน่งของบีม ในบล็อกโพสต์ Reflection เขียนว่า Beam "ก้าวล้ำหน้าขอบเขต open-weight ของตะวันตก" และ "สามารถแข่งขันกับรุ่นเปิดที่ใหญ่กว่าเช่น GLM 5.2 และเข้าใกล้ Qwen 3.8-Max ในด้านการเขียนโค้ดและงานเอเจนต์" นอกจากนี้ยังยอมรับว่ารุ่นเปิดโล่งระดับแนวหน้าอย่าง Kimi K3 "ยังคงนำหน้าในด้านความสามารถดิบ"

คำเตือนสองประการสมควรได้รับการเน้น ประการแรก ทุกหมายเลขที่นี่จะได้รับการรายงานด้วยตนเองโดย Reflection ก่อนการประกาศน้ำหนัก และการตรวจสอบโดยอิสระจะทำได้ก็ต่อเมื่อรายงานทางเทคนิคและจุดตรวจสอบเปิดเผยต่อสาธารณะเท่านั้น ประการที่สอง เซลล์หลายเซลล์ในตารางของบริษัทถูกทำเครื่องหมายว่าไม่ได้รายงาน ซึ่งทำให้การเปรียบเทียบระหว่างแอปเปิ้ลกับแอปเปิ้ลโดยสมบูรณ์เป็นไปไม่ได้ในขณะนี้

ข้อโต้แย้งด้านประสิทธิภาพ

สิ่งที่ Reflection นำเสนอในฐานะข้อได้เปรียบที่แท้จริงของ Beam ไม่ใช่ตำแหน่งกระดานผู้นำแบบดิบ แต่เป็นต้นทุน ณ เวลาอนุมาน เนื่องจากมีพารามิเตอร์เพียง 23 พันล้านจาก 501 พันล้านพารามิเตอร์ที่เปิดใช้งานต่อโทเค็น บริษัทจึงโต้แย้งว่า Beam สามารถส่งมอบประสิทธิภาพเอเจนต์และการเข้ารหัสที่ใกล้ขอบเขตได้ในราคาเพียงเล็กน้อยของต้นทุนการประมวลผลของโมเดลที่มีความหนาแน่นมากขึ้น การวางตำแหน่งดังกล่าวสะท้อนให้เห็นถึงกลยุทธ์ที่ทำให้ครอบครัวจีนแบบเปิดได้รับความนิยมอย่างมากในธุรกิจสตาร์ทอัพ นั่นคือความสามารถที่แข็งแกร่งเพียงพอในราคาที่ทำให้ตัวแทนที่ทำงานตลอดเวลามีศักยภาพในเชิงเศรษฐกิจ

หากการกล่าวอ้างด้านประสิทธิภาพยังคงอยู่รอดจากการเปรียบเทียบที่เป็นอิสระ ก็อาจมีความสำคัญมากกว่าเดลต้าบอร์ดผู้นำ ทีมที่ใช้เอเจนต์การเขียนโค้ดแบบขนานนับพันให้ความสำคัญกับต้นทุนต่องานที่เสร็จสมบูรณ์มากกว่าจุดอ้างอิงหลักเดียว

กระแสใต้น้ำทางภูมิรัฐศาสตร์

ความครอบคลุมของการเปิดตัวนั้นมีภูมิรัฐศาสตร์ที่โดดเด่นสำหรับการเปิดตัวโมเดลโอเพ่นซอร์ส Reuters อธิบายว่า Beam เป็น "โมเดล AI แรก" จาก Reflection ไปจนถึง "ใช้โมเดลเปิดของจีน" Fortune ถามว่า Beam อาจเป็น "โอกาสที่ดีที่สุดของอเมริกาในการแข่งขันกับจีน" หรือไม่ และ Semafor ตีกรอบบริษัทว่าเป็น "คำตอบแบบโอเพ่นซอร์สของตะวันตกสำหรับห้องปฏิบัติการของจีน"

เฟรมดังกล่าวสะท้อนให้เห็นถึงสถานะของระบบนิเวศแบบเปิดในช่วงปลายปี 2569 โดยโมเดลที่สามารถดาวน์โหลดได้มากที่สุดนั้นมาจากห้องปฏิบัติการของจีนอย่างล้นหลาม รวมถึงตระกูล GLM ของ Z.ai, กลุ่มผลิตภัณฑ์ Kimi ของ Moonshot, Qwen และ DeepSeek ของ Alibaba ห้องปฏิบัติการในอเมริกาปิดน้ำหนักที่ดีที่สุดไว้เป็นส่วนใหญ่ โดยเดิมพันกับรายได้จาก API แทน การสะท้อนกลับเป็นสิ่งที่ตรงกันข้าม: โมเดลชายแดนตะวันตกแบบเปิดสามารถดึงดูดระบบนิเวศของนักพัฒนาได้ และการสนับสนุนจาก Nvidia ทำให้มีทางวิ่งทางการคำนวณให้ตามทัน

จะเกิดอะไรขึ้นต่อไป

การปล่อยน้ำหนักในปลายเดือนนี้จะตอบคำถามที่สำคัญ: วิธีที่ Beam ดำเนินการนอกเหนือจากการประเมินของ Reflection ใบอนุญาตใดที่มาพร้อมกับตุ้มน้ำหนัก และประสิทธิภาพจะคงอยู่ภายใต้โหลดที่เป็นอิสระหรือไม่ ก่อนหน้านั้น Beam ยังคงเป็นตารางเกณฑ์มาตรฐาน แบบฟอร์มลงทะเบียน และคำมั่นสัญญาแบบเปิดที่เป็นผลสืบเนื่องมากที่สุดที่ห้องปฏิบัติการในอเมริกาได้ทำไว้ในปีนี้

สำหรับนักพัฒนาที่กำลังตัดสินใจว่าจะสร้างมาตรฐานบน GLM, Kimi, Qwen หรือรอ Beam คำแนะนำเชิงปฏิบัติคือให้ทำการตัดสินใจขั้นสุดท้ายจนกว่ารายงานทางเทคนิคและการประเมินโดยบุคคลที่สามจะลงมือ การแข่งขันรุ่นโอเพ่นเวตมีผู้เข้าแข่งขันชาวอเมริกันรายใหม่ และเป็นครั้งแรกในรอบหนึ่งที่ไม่ได้ออกสตาร์ทจากกลุ่มหลัง

ก้าวนำหน้า AI

พรมแดนแบบเปิดจะเคลื่อนไหวทุกสัปดาห์ และห้องแล็บจะปล่อยออกมาเร็วกว่าใครๆ ก็สามารถติดตามได้ อ่านข่าว AI เพิ่มเติมบน AI Buzz Wire สำหรับการเปิดตัวโมเดล การแยกย่อยของเกณฑ์มาตรฐาน และเรื่องราวทางธุรกิจที่อยู่เบื้องหลัง

สำรวจการพัฒนา AI ล่าสุดได้ที่นี่