NVIDIA ได้เปิดตัว Nemotron 3 Embed ซึ่งเป็นคอลเลกชันแบบเปิดของโมเดลการฝังที่ออกแบบมาเพื่อขับเคลื่อนการสร้างการดึงข้อมูล-augmented ระดับการผลิต (RAG) การดึงข้อมูลแบบเอเจนต์ การดึงรหัส และหน่วยความจำเอเจนต์ การเผยแพร่ซึ่งมีรายละเอียดโดย MarkTechPost เมื่อวันที่ 17 กรกฎาคม 2026 มาถึงในขณะที่เลเยอร์ตัดสินว่าข้อความใดที่ตัวแทน AI เคยพบเห็นกลายเป็นสมรภูมิการแข่งขัน ซึ่งเป็นเทรนด์ [ข่าวด่วน AI] (https://aibuzzwire.news) ของสิ่งพิมพ์นี้ที่ติดตามในขณะที่องค์กรต่างๆ ย้ายจากแชทบอทไปยังระบบที่ดำเนินการตามความรู้ที่ดึงมา

โมเดลที่ฝังจะตัดสินว่าข้อความใดที่เจ้าหน้าที่เคยเห็น ซึ่งทำให้เป็นช่องทางที่เงียบแต่เด็ดขาดในสแต็ก AI ที่สร้าง NVIDIA สร้าง Nemotron 3 Embed เพื่อเสริมความแข็งแกร่งให้กับเลเยอร์นั้น คอลเลกชันนี้ประกอบด้วยจุดตรวจสอบที่เปิดอยู่สามจุด ได้แก่ Nemotron-3-Embed-8B-BF16 ซึ่งเป็นตัวเลือกที่มีความแม่นยำเป็นอันดับแรก Nemotron-3-Embed-1B-BF16 ซึ่งมีการออกแบบเดียวกันแต่มีขนาดเล็กลง และ Nemotron-3-Embed-1B-NVFP4 ซึ่งเป็นตัวแปร 4 บิตที่ปรับให้เหมาะสมกับ Blackwell ทั้งสามตัวเป็นตัวเข้ารหัสหม้อแปลงที่ได้รับการฝึกด้วยการมาสก์ความสนใจแบบสองทิศทาง ด้วยการฝังขั้นสุดท้ายที่เกิดจากการรวมค่าเฉลี่ยเหนือการแสดงระดับโทเค็น แต่ละอันรองรับความยาวลำดับสูงสุด 32,768 โทเค็น

เติมลีดเดอร์บอร์ด

ผลลัพธ์พาดหัวก็คือ Nemotron-3-Embed-8B-BF16 ครองอันดับหนึ่งโดยรวมใน RTEB ซึ่งเป็นเกณฑ์มาตรฐานการฝังตัวในการดึงข้อมูล ณ วันที่ 17 กรกฎาคม 2026 จากงานสาธารณะ 16 งาน คะแนนจะถูกวัดเป็นค่าเฉลี่ย NDCG@10 ที่ความยาวลำดับแบบจำลองที่ 4,096 NVIDIA ประเมินแต่ละรุ่นใน 34 ภาษา และจุดตรวจสอบทั้งสามจุดได้รับการเผยแพร่ภายใต้ข้อตกลงใบอนุญาต OpenMDW เวอร์ชัน 1.1 ทำให้นักพัฒนาสามารถดาวน์โหลด เรียกใช้ และแก้ไขได้อย่างอิสระ

โดยเฉพาะอย่างยิ่ง ฐานโมเดลนั้นมาจาก Mistral จุดตรวจ 8B สร้างขึ้นบน Ministral-3-8B-Instruct-2512 ในขณะที่ 1B ทั้งสองรุ่นใช้ Ministral-3-3B-Instruct-2512 ตามรายงานของ MarkTechPost การตัดสินใจของ NVIDIA ที่จะสร้างบนรากฐานของ Mistral แทนที่จะเป็นสถาปัตยกรรมภายในองค์กรล้วนๆ สะท้อนให้เห็นถึงการพัฒนาโมเดลที่ลื่นไหล โดยมีฐานแบบเปิดที่ได้รับการปรับเปลี่ยนเป็นประจำและฝึกอบรมใหม่สำหรับงานเฉพาะทาง

การบีบอัด ไม่ใช่การฝึกซ้อมที่เล็กลง

ช่องว่างด้านประสิทธิภาพสองช่องโดดเด่น แบบจำลอง 1B ได้รับคะแนน RTEB 10.4 คะแนน เหนือระดับพื้นฐาน llama-nemotron-embed-vl-1b-v2 รุ่นก่อนหน้า จุดตรวจสอบ NVFP4 4 บิตแยกกันมีราคาเพียง 0.38 คะแนน RTEB เทียบกับจุดแม่ BF16 โดยยังคงความแม่นยำในการดึงข้อมูลไว้ประมาณ 99.5% การบีบอัดข้อมูลแบบเกือบสูญเสียนั้นมีความสำคัญอย่างยิ่งสำหรับทีมที่ต้องการรันการฝังในวงกว้าง ซึ่งต้นทุนหน่วยความจำและการอนุมานมักจะครอบงำ

คะแนน 1B เหล่านั้นทำได้โดยผ่านท่ออัดมากกว่าการฝึกซ้อมที่มีขนาดเล็กลง ตัวพาเรนต์ nemotron-3-embed-3b ถูกตัดแต่งและกลั่นโดยทำซ้ำสองรอบ อันดับแรก 3B พาเรนต์ถูกตัดเหลือ 2B โดยใช้ mcore_minitron Neural Architecture Search ของ NVIDIA ModelOpt ซึ่งค้นหาความกว้างที่ซ่อนอยู่ ขนาด FFN ส่วนหัวของความสนใจ และความลึก จากนั้นเลือกตัวเลือกที่ดีที่สุดจากแนวหน้า Pareto 10 อันดับแรก คลังข้อมูลการสอบเทียบในโดเมนตัวอย่าง 50,000 ตัวอย่างให้คะแนนผู้สมัครเหล่านั้น

ต่อไป แบบจำลอง 2B ได้รับการกลั่นจากครูผู้สอนการฝัง 8B ที่ได้รับการปรับแต่งอย่างละเอียด โดยผสมผสานการสูญเสียระยะทางโคไซน์และการสูญเสียข้อผิดพลาดกำลังสองเฉลี่ยผ่านการผสมผสานข้อมูลในโดเมนหลายภาษา ขั้นตอนเดียวกันนี้ถูกทำซ้ำเพื่อสร้างจุดตรวจสอบ 1.14B ซึ่งแสดงให้เห็นว่ารุ่นเล็กสืบทอดความสามารถของรุ่นใหญ่กว่าผ่านการบีบอัดแบบมีโครงสร้างมากกว่าการฝึกแบบอิสระ

สร้างขึ้นเพื่อประสิทธิภาพของ Blackwell

การบีบอัดยังคงอยู่ในรูปแบบการแสดง การหาปริมาณกำหนดเป้าหมายน้ำหนักและการเปิดใช้งานเลเยอร์เชิงเส้นเท่านั้น โดยใช้ประเภทข้อมูล NVFP4 โดยทีมวิจัยใช้ nvidia-modelopt v0.45.0 ปฏิบัติตามการกลั่นแบบการรับรู้เชิงปริมาณ โดยหลักๆ แล้วเพื่อฟื้นคืนความแม่นยำของอินพุตที่มีความยาว การสอบเทียบใช้ตัวอย่าง 512 ตัวอย่าง โดยแยกระหว่าง 256 แบบสอบถามและ 256 ข้อความจากชุดข้อมูล cnn_dailymail ในขณะที่การฝึกอบรม QAD ดึงตัวอย่าง 20,000 ตัวอย่าง

ผลตอบแทนที่คุ้มค่าในทางปฏิบัติคือประสิทธิภาพของฮาร์ดแวร์ล่าสุดของ NVIDIA ทีมวิจัยรายงานว่า NVFP4 บน Blackwell ให้ปริมาณงานสูงกว่า BF16 ถึง 2 เท่า ในขณะที่ยังคงความแม่นยำในการดึงข้อมูล BF16 มากกว่า 99% การ์ดโมเดล NVFP4 ยังบันทึกขนาดการฝังแบบไดนามิก ช่วยให้นักพัฒนาสามารถแบ่งเวกเตอร์ 2,048 มิติให้เหลือ 1,024 หรือ 512 มิติ แล้วปรับให้เป็นมาตรฐานใหม่ในภายหลัง โดยแลกกับความแม่นยำเพียงเล็กน้อยเพื่อลดต้นทุนพื้นที่จัดเก็บ ความยืดหยุ่นนั้นมีความสำคัญสำหรับฐานข้อมูลเวกเตอร์ ซึ่งการจัดเก็บเวกเตอร์มิติสูงหลายพันล้านรายการนั้นมีราคาแพง

ทำไมการฝังจึงมีความสำคัญในตอนนี้

โมเดลที่ฝังกลายเป็นจุดควบคุมที่เงียบสงบในสแต็ก AI ทั่วไป เอเจนต์ตามการดึงข้อมูล เครื่องมือค้นหาระดับองค์กร และผู้ช่วยโค้ดทุกรายการขึ้นอยู่กับเอเจนต์เหล่านั้นเพื่อดึงข้อมูลบริบทที่ถูกต้องก่อนที่โมเดลภาษาขนาดใหญ่จะสร้างการตอบกลับ โมเดลการฝังที่แข็งแกร่งและราคาถูกกว่าสามารถปรับปรุงคุณภาพคำตอบได้โดยตรงและลดต้นทุนการดำเนินงาน ซึ่งเป็นเหตุผลว่าทำไมผู้จำหน่ายตั้งแต่ OpenAI ถึง Cohere ไปจนถึงกลุ่มโอเพ่นซอร์สจึงรีบเร่งเปิดตัวตระกูลใหม่

ด้วยการโอเพ่นซอร์สคอลเลกชันที่ได้รับการจัดอันดับสูงสุดภายใต้ใบอนุญาตที่ได้รับอนุญาตและจับคู่กับปริมาณที่ปรับแต่งโดย Blackwell NVIDIA กำลังเสริมกลยุทธ์ในการเพาะระบบนิเวศ AI ในวงกว้างด้วยเครื่องมือที่ทำงานได้ดีที่สุดบนซิลิคอนของตัวเอง สำหรับนักพัฒนาที่สร้างไปป์ไลน์ RAG หรือระบบหน่วยความจำเอเจนต์ Nemotron 3 Embed นำเสนอตัวเลือกใหม่และใช้งานได้ฟรี ซึ่งผลักดันความทันสมัยบนเกณฑ์มาตรฐานที่ได้รับการจับตามองอย่างกว้างขวาง ในขณะที่ตัวแปร NVFP4 ช่วยให้ทีมมีเส้นทางที่น่าเชื่อถือในการลดต้นทุนการอนุมาน โดยไม่กระทบต่อคุณภาพการเรียกค้นที่แอปพลิเคชันของพวกเขาขึ้นอยู่กับ

ก้าวนำหน้า AI

โมเดลการฝังแบบเปิด เช่น Nemotron 3 Embed กำลังปรับโฉมวิธีที่เจ้าหน้าที่ AI ค้นหาและใช้ข้อมูลอย่างเงียบๆ หากต้องการข้อมูลเพิ่มเติมเกี่ยวกับโมเดล การเผยแพร่ และการวิจัยที่ขับเคลื่อนวงการไปข้างหน้า โปรดติดตาม การพัฒนา AI ล่าสุด ของเรา

อ่านข่าว AI เพิ่มเติม ->