گوگل Gemini 3.8 Flash را روز سه‌شنبه راه‌اندازی کرد، جدیدترین مدل اسب کاری خود که به عنوان بهترین سیستم استدلال و کدنویسی شرکت و با همان قیمت نسخه قبلی خود، در کنار یک نوع تخصصی به نام Gemini 3.8 Flash Cyber ​​که برای کارهای دفاعی امنیت سایبری ساخته شده است. این اطلاعیه که توسط Tulsee Doshi، مدیر ارشد مدیریت محصول، و Raluca Ada Popa، مدیر امنیتی Gemini در Google DeepMind در وبلاگ رسمی گوگل منتشر شده است، سومین انتشار فلش گوگل در تنها شش هفته است.

این راه‌اندازی در میانه‌ی یک فصل انتشار غیرمعمول شلوغ انجام می‌شود و پاسخی مستقیم به فشار قیمت و عملکردی است که رقبای روی خط مدل گوگل اعمال کرده‌اند. برای دید گسترده‌تری از نحوه معامله در آزمایشگاه‌های مرزی، تیم [اخبار جدید هوش مصنوعی] (https://aibuzzwire.news) هر نسخه اصلی مدل را در زمان وقوع ردیابی می‌کند.

دو نوع، یک پایه

Gemini 3.8 در دو نسخه ساخته شده بر اساس هوش پایه یکسان عرضه می شود. Gemini 3.8 Flash یک اسباب کار همه منظوره است: گوگل می گوید که پیشرفت های قابل توجهی را نسبت به Flash 3.7 در مهندسی نرم افزار، وظایف نمایندگی و استدلال چند مرحله ای در حوزه های تخصصی، با همان قیمت اولیه 0.75 دلار به ازای هر میلیون توکن ورودی و 3.75 دلار برای هر میلیون توکن خروجی ارائه می دهد.

Gemini 3.8 Flash Cyber ​​به عنوان تواناترین مدل امنیت سایبری گوگل با آنچه این شرکت آن را عملکرد سطح مرزی در تشخیص آسیب‌پذیری و وصله خودکار می‌نامد، توصیف می‌شود. برخلاف مدل استاندارد فلش، به طور گسترده در دسترس نیست - گوگل آن را از طریق یک برنامه جدید به نام Fairwind بین مجموعه ای از مدافعان قابل اعتماد توزیع می کند.

با توجه به پست وبلاگ، دستاوردهای کدنویسی و استدلال در سراسر هسته مشترک تا حدی ناشی از آموزش دقیق در حوزه تقاضای امنیت سایبری بوده است و هر دو مدل توسط حلقه‌های عامل طولانی مدت طراحی شده برای ارزیابی بازگشتی و اصلاح مدل‌های اساسی تسریع شده‌اند.

معیارها: سخت تر کار کردن، نه فقط بزرگتر شدن

ادعاهای معیار گوگل بر فلسفه طراحی متمرکز است که این شرکت به طور واضح آن را خلاصه می کند: 3.8 Flash "سخت تر کار می کند." در کارهای پیچیده، مدل مراحل استدلال اضافی را اجرا می‌کند و ابزارها را به‌طور مکرر فراخوانی می‌کند، گاهی اوقات برای به حداکثر رساندن عملکرد در سطوح تلاش بالاتر، توکن‌های بیشتری مصرف می‌کند. توسعه‌دهندگان می‌توانند برای کاهش سربار توکن، تلاش خود را کاهش دهند، یا در Gemini 3.7 Flash باقی بمانند، که به طور کامل برای بارهای کار بازده اول پشتیبانی می‌شود.

نتایج سرفصل هایی که گوگل به آنها اشاره می کند:

  • DeepSWE نسخه 1.1 (مهندسی نرم افزار افق بلند): 3.8 Flash در حل مستقل مسائل مهندسی پیچیده از انتها به انتها، با آنچه گوگل به عنوان کسری از هزینه توصیف می کند، از اکثر مدل های مرزی بزرگتر بهتر عمل می کند.
  • Vals Finance Agent V2 و معیار نماینده قانونی هاروی: 3.8 Flash از 3.7 Flash و سایر مدل های مرزی در زمینه های کمی و حرفه ای که نیاز به تجزیه و تحلیل و گزارش پیشرفته دارند، بهتر عمل می کند.
  • HLE-Verified: 3.8 Flash به 54.9% می رسد که گوگل آن را به عنوان مدرکی از استدلال چند مرحله ای در STEM، علوم انسانی و زمینه های حرفه ای ارائه می کند.

فلش سایبر: دفاع در برابر حمله

نوع Cyber نسخه غیرعادی تر است. گوگل می گوید که عمدا رفع آسیب پذیری را بر قابلیت های تهاجمی مانند بهره برداری در اولویت قرار داده است. در CWE-Bench، یک بنچمارک وصله خارجی که توسط Collinear اجرا می‌شود، Gemini 3.8 Flash Cyber ​​امتیاز 47.2% را به دست آورد - به گفته گوگل دقیقاً پشت یک مدل پیشرو با 47.8٪، اما با هزینه بسیار کمتر، و آن را در مرز Pareto معیار قرار می‌دهد.

در CyberGym، یک معیار استاندارد در صنعت برای یافتن آسیب‌پذیری‌ها، گوگل می‌گوید مدل Cyber ​​کشف آسیب‌پذیری مستقل در سطح مرزی را نشان می‌دهد و از نسل قبلی خود یعنی 3.5 Flash Cyber ​​و همچنین مدل‌های مرزی بسیار بزرگ‌تر پیشی می‌گیرد. در معیار داخلی گوگل که شامل پایگاه های کد پیچیده در 20 زبان برنامه نویسی است، این مدل به نرخ موفقیت بیش از 70 درصد رسید.

قبلاً کد خود گوگل را ایمن می کند

گوگل می گوید که مدل Cyber قبلاً به صورت داخلی مستقر شده است و نمونه هایی که ارائه می دهد خاص هستند:

  • تیم امنیتی Chrome دریافت که 3.8 Flash Cyber ​​2.6 برابر بیشتر از بهترین مدل‌های تجاری، که بسیار بزرگتر هستند، وصله‌های صحیح‌تری برای آسیب‌پذیری‌های Chrome تولید می‌کند.
  • در شرکت امنیتی Wiz، مدل 7.5 تا 9.7 درصد بالاتری را در معیار تست نفوذ داخلی با 2.3 تا 5.2 برابر هزینه کمتر در مقایسه با سایر مدل‌های مرزی پیشرو به دست آورد.
  • تیم تحقیقات آسیب‌پذیری ابری گوگل از این مدل برای یافتن یک آسیب‌پذیری اساسی در کمتر از دو ساعت استفاده کرد - طبقه‌ای از آسیب‌پذیری که، گوگل اشاره می‌کند، تحقیق و کشف آن معمولاً ماه‌ها طول می‌کشد.

چه معنایی برای توسعه دهندگان و بازار دارد

برای توسعه دهندگان، راهکار عملی ثبات قیمت در انتهای مرز است. نگه داشتن 3.8 Flash با قیمت اولیه 3.7، هزینه یک مدل رقابتی کدگذاری و عاملی را در 0.75 دلار / 3.75 دلار به ازای هر میلیون توکن نگه می‌دارد، بخشی که در آن رقبای وزن باز و آزمایشگاه‌های رقیب در تمام سال از شرکت‌های فعلی پایین‌تر آورده‌اند. پیام گوگل این است که خریداران دیگر نیازی به انتخاب بین هزینه و توانایی در ردیف کار ندارند.

مدل توزیع برنامه Fairwind برای Flash Cyber ​​به همان اندازه گویا است. آزمایشگاه‌های سطح اول به طور فزاینده‌ای با قابلیت امنیت سایبری نخبگان به‌عنوان چیزی که باید در آن قرار گیرد به جای ارسال گسترده برخورد می‌کنند – ارائه ابزارهای دفاعی پیشرفته برای مدافعان بررسی‌شده در حالی که پتانسیل سوء استفاده تهاجمی را محدود می‌کند. تصمیم گوگل برای اولویت دادن به معیارهای اصلاحی بر قابلیت های بهره برداری در آموزش مدل از همین منطق پیروی می کند.

آهنگ نیز قابل توجه است. سه نسخه Flash در شش هفته - 3.7 Flash سه هفته پیش، اکنون 3.8 - نشان می دهد که Google خط میانی خود را بسیار سریعتر از چرخه های انتشار سالانه دو سال پیش تکرار می کند. فشار رقابتی ناشی از عرضه GPT-6 OpenAI و موجی از مدل‌های وزن باز سریع از چین، جدول زمانی همه را فشرده کرده است، و گوگل به وضوح سرعت را در سطح اسب بخار انتخاب می‌کند در حالی که مدل‌های مرزی آن پرچم تحقیقات را دارند.

این که آیا رویکرد 3.8 Flash «سخت‌تر کار می‌کند» - صرف توکن‌های بیشتر برای استدلال چند مرحله‌ای سخت‌گیرانه - در عمل کارآمدتر از مقیاس مدل خام است، در صورت‌حساب‌های توسعه‌دهندگان در ماه‌های آینده نشان داده خواهد شد. معیارهای خود گوگل نشان می دهد که این تجارت می تواند به نفع تلاش باشد. بازار حکم خود را هر بار یک قبض API صادر می کند.

از هوش مصنوعی جلوتر بمانید

هر مدل عرضه، معیار و تغییر قیمت، در صورت وقوع ردیابی می شود — اخبار هوش مصنوعی بیشتر بخوانید →