شرکت آلمانی هوش مصنوعی Aleph Alpha، Kolibri را منتشر کرده است، یک مدل زبانی ترکیبی از متخصصان که از ابتدا برای آلمانی و انگلیسی ساخته شده است. این مدل دارای 78.1 میلیارد پارامتر کل است اما تنها 3.46 میلیارد از آنها را در هر توکن فعال می کند - حدود 4.4 درصد - و تحت مجوز مجاز آپاچی 2.0 در Hugging Face ارسال می شود. حداکثر 1,048,576 توکن زمینه را می پذیرد و به کاربران امکان می دهد تلاش استدلالی را برای هر درخواست تعیین کنند. برای خوانندگانی که اکوسیستم وزن‌های باز را دنبال می‌کنند، این مورد در کنار [آخرین پیشرفت‌های هوش مصنوعی] (https://aibuzzwire.news) ما قرار می‌گیرد.

این انتشار بیانیه ای عمدی در مورد جایی است که الف آلفا بازار خود را می بیند: استقرار مستقل در بخش های تنظیم شده مانند مدیریت دولتی، صنعت و هوافضا، جایی که دقیقاً دانستن اینکه یک مدل در کجا آموزش داده شده است، بر روی چه داده هایی و تحت چه چارچوب قانونی مناسبی برای داشتن نیست، بلکه یک الزام تدارکاتی است.

در واقع کولیبری چیست

Kolibri که در مواد فنی به آن Kolibri-1 می‌گویند، یک ترانسفورماتور MoE دو زبانه انگلیسی-آلمانی است که Aleph Alpha می‌گوید توسط تیم‌هایی در آلمان ساخته شده است. بر اساس گزارش تحقیقات فنی این شرکت، تیم به جای شروع از ایست بازرسی آزمایشگاه دیگر، خط لوله کامل - داده ها، معماری، زیرساخت های آموزشی، پس از آموزش و ارزیابی را کنترل کرد.

آموزش بر روی زیرساخت های واقع در آلمان و فنلاند اجرا شد. فرآیند طراحی صراحتاً انطباق با آیین‌نامه عملکرد هوش مصنوعی اتحادیه اروپا، قانون هوش مصنوعی اتحادیه اروپا و GDPR را هدف قرار داده است و الف آلفا یکی از امضاکنندگان آن کد است. این شرکت می‌گوید خط لوله داده‌های آن قبل از آموزش داده‌های شخصی را ویرایش می‌کند، جزئیاتی که مستقیماً خریداران بخش عمومی را هدف قرار می‌دهد که نمی‌توانند به طور قانونی داده‌های شهروندان را به مدل‌هایی با منشأ نامشخص وارد کنند.

روی یک GPU اجرا می شود

قابلیت استقرار به وضوح یک محدودیت طراحی بود، نه یک فکر بعدی. پوینت بازرسی FP8 تقریباً 78 گیگابایت وزن دارد و روی یک NVIDIA B200، B300 یا H200 - یا دو پردازنده گرافیکی H100 SXM5 - اجرا می‌شود که از طریق vLLM با استدلال اختصاصی Kolibri و تجزیه‌کننده‌های تماس ابزار ارائه می‌شود. برای یک مدل 78 میلیارد پارامتری، این ردپای سخت‌افزاری متوسطی است و نتیجه مستقیم طراحی پراکنده MOE است: با تنها 3.46 میلیارد پارامتر فعال در هر توکن، هزینه استنتاج تعداد پارامترهای فعال را به جای کل ردیابی می‌کند.

کارشناسان پراکنده و توجه ترکیبی

کولیبری در زیر کاپوت 50 بلوک ترانسفورماتور با عرض مدل 2560 روی هم چیده است. هر لایه MoE به تمام 384 متخصص مسیریابی شده با یک روتر سیگموئید امتیاز می‌دهد، هر توکن را به 6 مورد برتر ارسال می‌کند و همیشه یک متخصص مشترک را در کنار آنها اجرا می‌کند. بار تخصصی با استفاده از دو تکنیک با نام‌های الفبای سوپ متعادل می‌شود - متعادل‌سازی کمی دقیق و تزریق خطای بار - که باعث می‌شود روتر تمام ترافیک را بر روی تعداد معدودی متخصص فرو نبرد.

توجه جایی است که معماری جالب تر می شود. کولیبری از توجه جستجوی گروهی با 48 هد پرس و جو و 4 سر KV استفاده می کند، اما لایه ها یکنواخت نیستند: هر پنجمین بلوک از توجه کامل بدون رمزگذاری موقعیتی استفاده می کند، در حالی که 40 بلوک دیگر از توجه پنجره کشویی بر روی 512 توکن قبلی با RoPE استفاده می کنند. نتیجه عملی کارایی حافظه است - لایه‌های پنجره کشویی یک حافظه پنهان KV با اندازه ثابت نگه می‌دارند، بنابراین تنها 10 لایه از 50 لایه با طول زمینه رشد می‌کنند. در محاسبه همسان، الف آلفا گزارش می‌دهد که طراحی ترکیبی توالی‌هایی را چهار برابر طولانی‌تر از یک مدل مشابه با توجه کامل پشتیبانی می‌کند. به این ترتیب است که مدلی با این اندازه ادعا می کند که یک پنجره زمینه یک میلیون توکن بدون زیرساخت های عجیب و غریب دارد.

توکنایزر ساخته شده برای آلمانی

اکثر توکن سازهای مرزی آلمانی را به عنوان یک فکر بعدی در نظر می گیرند و کلمات مرکب طولانی آن را به قطعاتی تقسیم می کنند که تعداد نشانه ها و هزینه های موثر را افزایش می دهد. Aleph Alpha مستقیماً با UniBPE حمله کرد، واژگانی با 128000 توکن که ادغام‌هایی را مانند BPE ایجاد می‌کند اما هر ادغام را با از دست دادن Unigram امتیاز می‌دهد.

اعداد قضیه را نشان می دهند. در متن آلمانی، توکنایزر Kolibri به 4.90 بایت در هر توکن می رسد، در مقابل 4.35 برای توکنایزر GPT-5 - یعنی 11.2 درصد توکن های کمتر در متن وب آلمانی. در زبان انگلیسی، Kolibri در واقع جلوتر است، با 4.58 بایت در هر توکن در برابر 4.67 GPT-5. برای مشتریان سازمانی که به صورت توکن پرداخت می کنند، این یک تخفیف مستقیم برای هر بار کاری آلمانی زبان است.

در مقیاس مرزی آموزش دیده است

تمرینات پشت سر کولیبری قابل توجه است. قبل از آموزش 20 تریلیون توکن روی 768 پردازنده گرافیکی NVIDIA B200 را پوشش داد و به دنبال آن 3.44 تریلیون توکن در اواسط آموزش با طول توالی 65536 توکن قرار گرفت. سپس خط لوله از طریق مراحل تنظیم دقیق و تقویتی تحت نظارت حرکت کرد تا مدل نهایی با قابلیت استدلال و با پیروی از دستورالعمل تولید شود. این شرکت یک گزارش تحقیقات فنی منتشر کرده است که این فرآیند را پوشش می دهد، سطح غیرمعمولی از افشا برای یک آزمایشگاه اروپایی و به وضوح با هدف ایجاد اعتماد با مشتریان تحت نظارت.

برای فشار هوش مصنوعی اروپا چه معنایی دارد

کولیبری وارد بازاری می‌شود که در آن نسخه‌های آزاد از آزمایشگاه‌های آمریکایی و چینی بر گفتگو غالب است، و در آن دولت‌های اروپایی به طور فزاینده‌ای در مورد حاکمیت دیجیتال صحبت می‌کنند. شرط الف آلفا این است که بخشی از آن بازار - وزارتخانه‌ها، صنایع مجاور دفاعی، زیرساخت‌های حیاتی - برای مدلی که صرفاً وزن باز نیست، بلکه از نظر مدیریت داده‌ها، مکان آموزشی و وضعیت قانونی آن کاملا اروپایی است، هزینه خواهد کرد.

اینکه آیا این شرط‌بندی به ثمر می‌رسد بستگی به سؤالاتی دارد که انتشار هنوز به آنها پاسخ نمی‌دهد: چگونه Kolibri در ارزیابی‌های استاندارد در برابر مدل‌های باز مرزی معیار قرار می‌دهد و با چه سرعتی اکوسیستم ابزارسازی در اطراف آن شکل می‌گیرد. آنچه که انتشار نشان می دهد این است که یک قابلیت آموزشی تمام پشته و مرزی در حال حاضر در داخل اتحادیه اروپا وجود دارد، با مدارک لازم مطابقت دارد. برای سازمان‌هایی که به GDPR و قانون هوش مصنوعی وابسته هستند، این ترکیب ممکن است بیشتر از موقعیت‌های تابلوی امتیازات مهم باشد.

---

از هوش مصنوعی جلوتر بمانید

آخرین اخبار، تحلیل ها و پیشرفت های هوش مصنوعی را دریافت کنید - همه در یک مکان.

بیشتر بخوانید اخبار هوش مصنوعی →