บริษัท AI ของเยอรมนี Aleph Alpha ได้เปิดตัว Kolibri ซึ่งเป็นโมเดลภาษาแบบ Mixture-of-Experts แบบเปิดที่สร้างขึ้นใหม่ทั้งหมดสำหรับภาษาเยอรมันและอังกฤษ โมเดลดังกล่าวบรรจุพารามิเตอร์ทั้งหมด 78.1 พันล้านพารามิเตอร์ แต่เปิดใช้งานเพียง 3.46 พันล้านพารามิเตอร์ต่อโทเค็น – ประมาณ 4.4 เปอร์เซ็นต์ – และจัดส่งภายใต้ใบอนุญาต Apache 2.0 ที่อนุญาตบน Hugging Face ยอมรับโทเค็นบริบทได้มากถึง 1,048,576 รายการ และให้ผู้ใช้กำหนดความพยายามในการให้เหตุผลตามคำขอ สำหรับผู้อ่านที่ติดตามระบบนิเวศ Open-Weights สิ่งนี้จะควบคู่ไปกับ การพัฒนา AI ล่าสุด ของเรา
การเปิดตัวนี้เป็นแถลงการณ์โดยเจตนาเกี่ยวกับจุดที่ Aleph Alpha มองตลาดของตน: การใช้งานโดยอธิปไตยในภาคส่วนที่มีการควบคุม เช่น การบริหารสาธารณะ อุตสาหกรรม และการบิน โดยที่ทราบอย่างแน่ชัดว่าแบบจำลองได้รับการฝึกอบรมที่ไหน ข้อมูลใด และภายใต้กรอบกฎหมายใดที่ไม่ควรมี แต่เป็นข้อกำหนดในการจัดซื้อจัดจ้าง
จริงๆ แล้ว Kolibri คืออะไร
Kolibri หรือที่เรียกในเอกสารทางเทคนิคว่า Kolibri-1 เป็นหม้อแปลง MoE สองภาษาอังกฤษ-เยอรมัน ที่ Aleph Alpha กล่าวว่าได้รับการพัฒนาแบบครบวงจรโดยทีมงานในเยอรมนี ตามรายงานการวิจัยทางเทคนิคของบริษัท ทีมงานควบคุมไปป์ไลน์ทั้งหมด เช่น ข้อมูล สถาปัตยกรรม โครงสร้างพื้นฐานการฝึกอบรม หลังการฝึกอบรม และการประเมินผล แทนที่จะเริ่มจากจุดตรวจสอบของห้องปฏิบัติการอื่น
การฝึกอบรมดำเนินการบนโครงสร้างพื้นฐานที่ตั้งอยู่ในประเทศเยอรมนีและฟินแลนด์ กระบวนการออกแบบมีเป้าหมายอย่างชัดเจนในการปฏิบัติตามหลักปฏิบัติด้าน AI วัตถุประสงค์ทั่วไปของสหภาพยุโรป พระราชบัญญัติ AI ของสหภาพยุโรป และ GDPR และ Aleph Alpha เป็นผู้ลงนามในหลักปฏิบัติดังกล่าว บริษัทกล่าวว่าไปป์ไลน์ข้อมูลจะแก้ไขข้อมูลส่วนบุคคลก่อนการฝึกอบรม ซึ่งเป็นรายละเอียดที่มุ่งเป้าไปที่ผู้ซื้อภาครัฐโดยตรงซึ่งไม่สามารถป้อนข้อมูลพลเมืองในรูปแบบที่มีที่มาที่ไม่ชัดเจนได้อย่างถูกกฎหมาย
มันทำงานบน GPU ตัวเดียว
เห็นได้ชัดว่าความสามารถในการปรับใช้เป็นข้อจำกัดในการออกแบบ ไม่ใช่สิ่งที่ตามมาภายหลัง จุดตรวจสอบ FP8 มีน้ำหนักประมาณ 78GB และทำงานบน NVIDIA B200, B300 หรือ H200 ตัวเดียว — หรือบน H100 SXM5 GPU สองตัว — ให้บริการผ่าน vLLM พร้อมเหตุผล Kolibri เฉพาะและตัวแยกวิเคราะห์การเรียกใช้เครื่องมือ สำหรับโมเดลที่มีพารามิเตอร์ 78 พันล้านพารามิเตอร์ นั่นเป็นขนาดฮาร์ดแวร์เพียงเล็กน้อย และเป็นผลตอบแทนโดยตรงของการออกแบบ MoE แบบเบาบาง โดยมีพารามิเตอร์ที่ใช้งานเพียง 3.46 พันล้านพารามิเตอร์ต่อโทเค็น ต้นทุนการอนุมานจะติดตามจำนวนพารามิเตอร์ที่ใช้งานอยู่มากกว่าจำนวนทั้งหมด
ผู้เชี่ยวชาญเบาบางและความสนใจแบบผสมผสาน
ภายใต้ฝากระโปรง Kolibri จะซ้อนบล็อกหม้อแปลง 50 ตัว โดยมีความกว้างของโมเดล 2,560 ตัว ทุกเลเยอร์ MoE จะให้คะแนนผู้เชี่ยวชาญที่กำหนดเส้นทางทั้งหมด 384 คนด้วยเราเตอร์ sigmoid ส่งแต่ละโทเค็นไปยัง 6 อันดับแรก และเรียกใช้ผู้เชี่ยวชาญที่แชร์ 1 คนเคียงข้างพวกเขาเสมอ โหลดของผู้เชี่ยวชาญมีความสมดุลโดยใช้สองเทคนิคที่มีชื่อเรียงตามตัวอักษร — Exact Quantile Balancing และ Load-Error — ซึ่งจะทำให้เราเตอร์ไม่ยุบการรับส่งข้อมูลทั้งหมดไปยังผู้เชี่ยวชาญเพียงไม่กี่คน
ความสนใจคือจุดที่สถาปัตยกรรมมีความน่าสนใจมากขึ้น Kolibri ใช้ความสนใจในการสืบค้นแบบกลุ่มโดยมีส่วนหัวของแบบสอบถาม 48 รายการและส่วนหัวของ KV 4 รายการ แต่เลเยอร์ไม่สม่ำเสมอ: ทุก ๆ บล็อกที่ห้าจะใช้ความสนใจอย่างเต็มที่โดยไม่มีการเข้ารหัสตำแหน่ง ในขณะที่อีก 40 บล็อกที่เหลือใช้ความสนใจของหน้าต่างแบบเลื่อนเหนือโทเค็นก่อนหน้า 512 โทเค็นด้วย RoPE ผลลัพธ์ในทางปฏิบัติคือประสิทธิภาพของหน่วยความจำ — เลเยอร์หน้าต่างบานเลื่อนเก็บแคช KV ที่มีขนาดคงที่ ดังนั้นมีเพียง 10 เลเยอร์จาก 50 เลเยอร์เท่านั้นที่จะขยายตามความยาวบริบท ในการประมวลผลที่ตรงกัน Aleph Alpha รายงานว่าการออกแบบไฮบริดรองรับลำดับที่ยาวกว่ารุ่นที่มีสมาธิเต็มที่เทียบเท่าถึงสี่เท่า นั่นคือวิธีที่โมเดลขนาดนี้อ้างสิทธิ์ในหน้าต่างบริบทหนึ่งล้านโทเค็นโดยไม่มีโครงสร้างพื้นฐานที่แปลกใหม่
tokenizer ที่สร้างขึ้นสำหรับชาวเยอรมัน
โทเค็นเซอร์ชายแดนส่วนใหญ่ถือว่าภาษาเยอรมันเป็นเพียงความคิดในภายหลัง โดยแยกคำประสมยาว ๆ ออกเป็นส่วน ๆ ซึ่งจะทำให้จำนวนโทเค็นเพิ่มขึ้นและต้นทุนที่แท้จริง Aleph Alpha โจมตีสิ่งนี้โดยตรงด้วย UniBPE ซึ่งเป็นคำศัพท์ 128,000 โทเค็นที่สร้างการผสานแบบเดียวกับที่ BPE ทำ แต่ให้คะแนนการผสานแต่ละครั้งด้วยการสูญเสีย Unigram
ตัวเลขทำให้เกิดกรณี ในข้อความภาษาเยอรมัน Tokenizer ของ Kolibri มีจำนวนถึง 4.90 ไบต์ต่อโทเค็น เทียบกับ 4.35 สำหรับ GPT-5 tokenizer ซึ่งหมายถึงโทเค็นน้อยลง 11.2 เปอร์เซ็นต์ในข้อความเว็บภาษาเยอรมัน สำหรับภาษาอังกฤษ Kolibri ก็ออกมาข้างหน้าเช่นกันที่ 4.58 ไบต์ต่อโทเค็นเทียบกับ GPT-5 4.67 สำหรับลูกค้าองค์กรที่ชำระเงินด้วยโทเค็น นั่นเป็นส่วนลดโดยตรงสำหรับปริมาณงานภาษาเยอรมันทั้งหมด
ฝึกฝนในระดับชายแดน
การฝึกซ้อมที่อยู่เบื้องหลัง Kolibri นั้นสำคัญมาก การฝึกอบรมล่วงหน้าครอบคลุมโทเค็น 20 ล้านล้านโทเค็นบน GPU NVIDIA B200 จำนวน 768 ตัว ตามด้วยโทเค็นการฝึกกลางจำนวน 3.44 ล้านล้านโทเค็นที่ความยาวลำดับโทเค็น 65,536 โทเค็น จากนั้นไปป์ไลน์จะเคลื่อนผ่านขั้นตอนการปรับแต่งอย่างละเอียดและการเสริมกำลังภายใต้การดูแลภายใต้การดูแล เพื่อสร้างโมเดลที่มีความสามารถในการใช้เหตุผลตามคำสั่งขั้นสุดท้าย บริษัทได้เผยแพร่รายงานการวิจัยทางเทคนิคที่ครอบคลุมกระบวนการนี้ ระดับการเปิดเผยข้อมูลที่ผิดปกติสำหรับห้องปฏิบัติการในยุโรป และรายงานที่มุ่งเป้าไปที่การสร้างความไว้วางใจกับลูกค้าที่ได้รับการควบคุมอย่างชัดเจน
ความหมายของการผลักดัน AI ของยุโรป
Kolibri เข้าสู่ตลาดที่การเผยแพร่แบบเปิดจากห้องปฏิบัติการของอเมริกาและจีนครองการสนทนา และที่ซึ่งรัฐบาลยุโรปเริ่มแสดงความเห็นเกี่ยวกับอธิปไตยทางดิจิทัลมากขึ้นเรื่อยๆ การเดิมพันของ Aleph Alpha ก็คือ ส่วนหนึ่งของตลาดนั้น เช่น กระทรวง อุตสาหกรรมที่อยู่ติดกันด้านกลาโหม โครงสร้างพื้นฐานที่สำคัญ จะจ่ายเงินให้กับโมเดลที่ไม่เพียงแต่เป็นแบบเปิดเท่านั้น แต่ยังสามารถตรวจสอบได้ของยุโรปในการจัดการข้อมูล สถานที่ฝึกอบรม และท่าทางทางกฎหมาย
การเดิมพันนั้นจะได้ผลหรือไม่นั้นขึ้นอยู่กับคำถามที่การเปิดตัวยังไม่ได้รับคำตอบ: วิธีที่ Kolibri เปรียบเทียบกับโมเดลแบบเปิดชายแดนในการประเมินมาตรฐาน และระบบนิเวศของเครื่องมือก่อตัวได้เร็วเพียงใด สิ่งที่การเปิดตัวดังกล่าวสร้างขึ้นก็คือ ความสามารถในการฝึกอบรมแบบเต็มรูปแบบและติดชายแดนนั้นมีอยู่ในสหภาพยุโรปแล้ว โดยมีเอกสารประกอบที่ตรงกัน สำหรับองค์กรที่ผูกพันกับ GDPR และพระราชบัญญัติ AI การรวมกันดังกล่าวอาจมีความสำคัญมากกว่าตำแหน่งในกระดานผู้นำ
---
ก้าวนำหน้า AIรับข่าวสาร AI การวิเคราะห์ และความก้าวหน้าล่าสุด ทั้งหมดในที่เดียว
อ่านข่าว AI เพิ่มเติม →