شرکت آلمانی هوش مصنوعی Aleph Alpha، Kolibri را منتشر کرده است، یک مدل زبانی ترکیبی از متخصصان که از ابتدا برای آلمانی و انگلیسی ساخته شده است. این مدل دارای 78.1 میلیارد پارامتر کل است اما تنها 3.46 میلیارد از آنها را در هر توکن فعال می کند - حدود 4.4 درصد - و تحت مجوز مجاز آپاچی 2.0 در Hugging Face ارسال می شود. حداکثر 1,048,576 توکن زمینه را می پذیرد و به کاربران امکان می دهد تلاش استدلالی را برای هر درخواست تعیین کنند. برای خوانندگانی که اکوسیستم وزنهای باز را دنبال میکنند، این مورد در کنار [آخرین پیشرفتهای هوش مصنوعی] (https://aibuzzwire.news) ما قرار میگیرد.
این انتشار بیانیه ای عمدی در مورد جایی است که الف آلفا بازار خود را می بیند: استقرار مستقل در بخش های تنظیم شده مانند مدیریت دولتی، صنعت و هوافضا، جایی که دقیقاً دانستن اینکه یک مدل در کجا آموزش داده شده است، بر روی چه داده هایی و تحت چه چارچوب قانونی مناسبی برای داشتن نیست، بلکه یک الزام تدارکاتی است.
در واقع کولیبری چیست
Kolibri که در مواد فنی به آن Kolibri-1 میگویند، یک ترانسفورماتور MoE دو زبانه انگلیسی-آلمانی است که Aleph Alpha میگوید توسط تیمهایی در آلمان ساخته شده است. بر اساس گزارش تحقیقات فنی این شرکت، تیم به جای شروع از ایست بازرسی آزمایشگاه دیگر، خط لوله کامل - داده ها، معماری، زیرساخت های آموزشی، پس از آموزش و ارزیابی را کنترل کرد.
آموزش بر روی زیرساخت های واقع در آلمان و فنلاند اجرا شد. فرآیند طراحی صراحتاً انطباق با آییننامه عملکرد هوش مصنوعی اتحادیه اروپا، قانون هوش مصنوعی اتحادیه اروپا و GDPR را هدف قرار داده است و الف آلفا یکی از امضاکنندگان آن کد است. این شرکت میگوید خط لوله دادههای آن قبل از آموزش دادههای شخصی را ویرایش میکند، جزئیاتی که مستقیماً خریداران بخش عمومی را هدف قرار میدهد که نمیتوانند به طور قانونی دادههای شهروندان را به مدلهایی با منشأ نامشخص وارد کنند.
روی یک GPU اجرا می شود
قابلیت استقرار به وضوح یک محدودیت طراحی بود، نه یک فکر بعدی. پوینت بازرسی FP8 تقریباً 78 گیگابایت وزن دارد و روی یک NVIDIA B200، B300 یا H200 - یا دو پردازنده گرافیکی H100 SXM5 - اجرا میشود که از طریق vLLM با استدلال اختصاصی Kolibri و تجزیهکنندههای تماس ابزار ارائه میشود. برای یک مدل 78 میلیارد پارامتری، این ردپای سختافزاری متوسطی است و نتیجه مستقیم طراحی پراکنده MOE است: با تنها 3.46 میلیارد پارامتر فعال در هر توکن، هزینه استنتاج تعداد پارامترهای فعال را به جای کل ردیابی میکند.
کارشناسان پراکنده و توجه ترکیبی
کولیبری در زیر کاپوت 50 بلوک ترانسفورماتور با عرض مدل 2560 روی هم چیده است. هر لایه MoE به تمام 384 متخصص مسیریابی شده با یک روتر سیگموئید امتیاز میدهد، هر توکن را به 6 مورد برتر ارسال میکند و همیشه یک متخصص مشترک را در کنار آنها اجرا میکند. بار تخصصی با استفاده از دو تکنیک با نامهای الفبای سوپ متعادل میشود - متعادلسازی کمی دقیق و تزریق خطای بار - که باعث میشود روتر تمام ترافیک را بر روی تعداد معدودی متخصص فرو نبرد.
توجه جایی است که معماری جالب تر می شود. کولیبری از توجه جستجوی گروهی با 48 هد پرس و جو و 4 سر KV استفاده می کند، اما لایه ها یکنواخت نیستند: هر پنجمین بلوک از توجه کامل بدون رمزگذاری موقعیتی استفاده می کند، در حالی که 40 بلوک دیگر از توجه پنجره کشویی بر روی 512 توکن قبلی با RoPE استفاده می کنند. نتیجه عملی کارایی حافظه است - لایههای پنجره کشویی یک حافظه پنهان KV با اندازه ثابت نگه میدارند، بنابراین تنها 10 لایه از 50 لایه با طول زمینه رشد میکنند. در محاسبه همسان، الف آلفا گزارش میدهد که طراحی ترکیبی توالیهایی را چهار برابر طولانیتر از یک مدل مشابه با توجه کامل پشتیبانی میکند. به این ترتیب است که مدلی با این اندازه ادعا می کند که یک پنجره زمینه یک میلیون توکن بدون زیرساخت های عجیب و غریب دارد.
توکنایزر ساخته شده برای آلمانی
اکثر توکن سازهای مرزی آلمانی را به عنوان یک فکر بعدی در نظر می گیرند و کلمات مرکب طولانی آن را به قطعاتی تقسیم می کنند که تعداد نشانه ها و هزینه های موثر را افزایش می دهد. Aleph Alpha مستقیماً با UniBPE حمله کرد، واژگانی با 128000 توکن که ادغامهایی را مانند BPE ایجاد میکند اما هر ادغام را با از دست دادن Unigram امتیاز میدهد.
اعداد قضیه را نشان می دهند. در متن آلمانی، توکنایزر Kolibri به 4.90 بایت در هر توکن می رسد، در مقابل 4.35 برای توکنایزر GPT-5 - یعنی 11.2 درصد توکن های کمتر در متن وب آلمانی. در زبان انگلیسی، Kolibri در واقع جلوتر است، با 4.58 بایت در هر توکن در برابر 4.67 GPT-5. برای مشتریان سازمانی که به صورت توکن پرداخت می کنند، این یک تخفیف مستقیم برای هر بار کاری آلمانی زبان است.
در مقیاس مرزی آموزش دیده است
تمرینات پشت سر کولیبری قابل توجه است. قبل از آموزش 20 تریلیون توکن روی 768 پردازنده گرافیکی NVIDIA B200 را پوشش داد و به دنبال آن 3.44 تریلیون توکن در اواسط آموزش با طول توالی 65536 توکن قرار گرفت. سپس خط لوله از طریق مراحل تنظیم دقیق و تقویتی تحت نظارت حرکت کرد تا مدل نهایی با قابلیت استدلال و با پیروی از دستورالعمل تولید شود. این شرکت یک گزارش تحقیقات فنی منتشر کرده است که این فرآیند را پوشش می دهد، سطح غیرمعمولی از افشا برای یک آزمایشگاه اروپایی و به وضوح با هدف ایجاد اعتماد با مشتریان تحت نظارت.
برای فشار هوش مصنوعی اروپا چه معنایی دارد
کولیبری وارد بازاری میشود که در آن نسخههای آزاد از آزمایشگاههای آمریکایی و چینی بر گفتگو غالب است، و در آن دولتهای اروپایی به طور فزایندهای در مورد حاکمیت دیجیتال صحبت میکنند. شرط الف آلفا این است که بخشی از آن بازار - وزارتخانهها، صنایع مجاور دفاعی، زیرساختهای حیاتی - برای مدلی که صرفاً وزن باز نیست، بلکه از نظر مدیریت دادهها، مکان آموزشی و وضعیت قانونی آن کاملا اروپایی است، هزینه خواهد کرد.
اینکه آیا این شرطبندی به ثمر میرسد بستگی به سؤالاتی دارد که انتشار هنوز به آنها پاسخ نمیدهد: چگونه Kolibri در ارزیابیهای استاندارد در برابر مدلهای باز مرزی معیار قرار میدهد و با چه سرعتی اکوسیستم ابزارسازی در اطراف آن شکل میگیرد. آنچه که انتشار نشان می دهد این است که یک قابلیت آموزشی تمام پشته و مرزی در حال حاضر در داخل اتحادیه اروپا وجود دارد، با مدارک لازم مطابقت دارد. برای سازمانهایی که به GDPR و قانون هوش مصنوعی وابسته هستند، این ترکیب ممکن است بیشتر از موقعیتهای تابلوی امتیازات مهم باشد.
---
از هوش مصنوعی جلوتر بمانیدآخرین اخبار، تحلیل ها و پیشرفت های هوش مصنوعی را دریافت کنید - همه در یک مکان.
بیشتر بخوانید اخبار هوش مصنوعی →