گوگل Gemini 3.8 Flash را روز سهشنبه راهاندازی کرد، جدیدترین مدل اسب کاری خود که به عنوان بهترین سیستم استدلال و کدنویسی شرکت و با همان قیمت نسخه قبلی خود، در کنار یک نوع تخصصی به نام Gemini 3.8 Flash Cyber که برای کارهای دفاعی امنیت سایبری ساخته شده است. این اطلاعیه که توسط Tulsee Doshi، مدیر ارشد مدیریت محصول، و Raluca Ada Popa، مدیر امنیتی Gemini در Google DeepMind در وبلاگ رسمی گوگل منتشر شده است، سومین انتشار فلش گوگل در تنها شش هفته است.
این راهاندازی در میانهی یک فصل انتشار غیرمعمول شلوغ انجام میشود و پاسخی مستقیم به فشار قیمت و عملکردی است که رقبای روی خط مدل گوگل اعمال کردهاند. برای دید گستردهتری از نحوه معامله در آزمایشگاههای مرزی، تیم [اخبار جدید هوش مصنوعی] (https://aibuzzwire.news) هر نسخه اصلی مدل را در زمان وقوع ردیابی میکند.
دو نوع، یک پایه
Gemini 3.8 در دو نسخه ساخته شده بر اساس هوش پایه یکسان عرضه می شود. Gemini 3.8 Flash یک اسباب کار همه منظوره است: گوگل می گوید که پیشرفت های قابل توجهی را نسبت به Flash 3.7 در مهندسی نرم افزار، وظایف نمایندگی و استدلال چند مرحله ای در حوزه های تخصصی، با همان قیمت اولیه 0.75 دلار به ازای هر میلیون توکن ورودی و 3.75 دلار برای هر میلیون توکن خروجی ارائه می دهد.
Gemini 3.8 Flash Cyber به عنوان تواناترین مدل امنیت سایبری گوگل با آنچه این شرکت آن را عملکرد سطح مرزی در تشخیص آسیبپذیری و وصله خودکار مینامد، توصیف میشود. برخلاف مدل استاندارد فلش، به طور گسترده در دسترس نیست - گوگل آن را از طریق یک برنامه جدید به نام Fairwind بین مجموعه ای از مدافعان قابل اعتماد توزیع می کند.
با توجه به پست وبلاگ، دستاوردهای کدنویسی و استدلال در سراسر هسته مشترک تا حدی ناشی از آموزش دقیق در حوزه تقاضای امنیت سایبری بوده است و هر دو مدل توسط حلقههای عامل طولانی مدت طراحی شده برای ارزیابی بازگشتی و اصلاح مدلهای اساسی تسریع شدهاند.
معیارها: سخت تر کار کردن، نه فقط بزرگتر شدن
ادعاهای معیار گوگل بر فلسفه طراحی متمرکز است که این شرکت به طور واضح آن را خلاصه می کند: 3.8 Flash "سخت تر کار می کند." در کارهای پیچیده، مدل مراحل استدلال اضافی را اجرا میکند و ابزارها را بهطور مکرر فراخوانی میکند، گاهی اوقات برای به حداکثر رساندن عملکرد در سطوح تلاش بالاتر، توکنهای بیشتری مصرف میکند. توسعهدهندگان میتوانند برای کاهش سربار توکن، تلاش خود را کاهش دهند، یا در Gemini 3.7 Flash باقی بمانند، که به طور کامل برای بارهای کار بازده اول پشتیبانی میشود.
نتایج سرفصل هایی که گوگل به آنها اشاره می کند:
- DeepSWE نسخه 1.1 (مهندسی نرم افزار افق بلند): 3.8 Flash در حل مستقل مسائل مهندسی پیچیده از انتها به انتها، با آنچه گوگل به عنوان کسری از هزینه توصیف می کند، از اکثر مدل های مرزی بزرگتر بهتر عمل می کند.
- Vals Finance Agent V2 و معیار نماینده قانونی هاروی: 3.8 Flash از 3.7 Flash و سایر مدل های مرزی در زمینه های کمی و حرفه ای که نیاز به تجزیه و تحلیل و گزارش پیشرفته دارند، بهتر عمل می کند.
- HLE-Verified: 3.8 Flash به 54.9% می رسد که گوگل آن را به عنوان مدرکی از استدلال چند مرحله ای در STEM، علوم انسانی و زمینه های حرفه ای ارائه می کند.
فلش سایبر: دفاع در برابر حمله
نوع Cyber نسخه غیرعادی تر است. گوگل می گوید که عمدا رفع آسیب پذیری را بر قابلیت های تهاجمی مانند بهره برداری در اولویت قرار داده است. در CWE-Bench، یک بنچمارک وصله خارجی که توسط Collinear اجرا میشود، Gemini 3.8 Flash Cyber امتیاز 47.2% را به دست آورد - به گفته گوگل دقیقاً پشت یک مدل پیشرو با 47.8٪، اما با هزینه بسیار کمتر، و آن را در مرز Pareto معیار قرار میدهد.
در CyberGym، یک معیار استاندارد در صنعت برای یافتن آسیبپذیریها، گوگل میگوید مدل Cyber کشف آسیبپذیری مستقل در سطح مرزی را نشان میدهد و از نسل قبلی خود یعنی 3.5 Flash Cyber و همچنین مدلهای مرزی بسیار بزرگتر پیشی میگیرد. در معیار داخلی گوگل که شامل پایگاه های کد پیچیده در 20 زبان برنامه نویسی است، این مدل به نرخ موفقیت بیش از 70 درصد رسید.
قبلاً کد خود گوگل را ایمن می کند
گوگل می گوید که مدل Cyber قبلاً به صورت داخلی مستقر شده است و نمونه هایی که ارائه می دهد خاص هستند:
- تیم امنیتی Chrome دریافت که 3.8 Flash Cyber 2.6 برابر بیشتر از بهترین مدلهای تجاری، که بسیار بزرگتر هستند، وصلههای صحیحتری برای آسیبپذیریهای Chrome تولید میکند.
- در شرکت امنیتی Wiz، مدل 7.5 تا 9.7 درصد بالاتری را در معیار تست نفوذ داخلی با 2.3 تا 5.2 برابر هزینه کمتر در مقایسه با سایر مدلهای مرزی پیشرو به دست آورد.
- تیم تحقیقات آسیبپذیری ابری گوگل از این مدل برای یافتن یک آسیبپذیری اساسی در کمتر از دو ساعت استفاده کرد - طبقهای از آسیبپذیری که، گوگل اشاره میکند، تحقیق و کشف آن معمولاً ماهها طول میکشد.
چه معنایی برای توسعه دهندگان و بازار دارد
برای توسعه دهندگان، راهکار عملی ثبات قیمت در انتهای مرز است. نگه داشتن 3.8 Flash با قیمت اولیه 3.7، هزینه یک مدل رقابتی کدگذاری و عاملی را در 0.75 دلار / 3.75 دلار به ازای هر میلیون توکن نگه میدارد، بخشی که در آن رقبای وزن باز و آزمایشگاههای رقیب در تمام سال از شرکتهای فعلی پایینتر آوردهاند. پیام گوگل این است که خریداران دیگر نیازی به انتخاب بین هزینه و توانایی در ردیف کار ندارند.
مدل توزیع برنامه Fairwind برای Flash Cyber به همان اندازه گویا است. آزمایشگاههای سطح اول به طور فزایندهای با قابلیت امنیت سایبری نخبگان بهعنوان چیزی که باید در آن قرار گیرد به جای ارسال گسترده برخورد میکنند – ارائه ابزارهای دفاعی پیشرفته برای مدافعان بررسیشده در حالی که پتانسیل سوء استفاده تهاجمی را محدود میکند. تصمیم گوگل برای اولویت دادن به معیارهای اصلاحی بر قابلیت های بهره برداری در آموزش مدل از همین منطق پیروی می کند.
آهنگ نیز قابل توجه است. سه نسخه Flash در شش هفته - 3.7 Flash سه هفته پیش، اکنون 3.8 - نشان می دهد که Google خط میانی خود را بسیار سریعتر از چرخه های انتشار سالانه دو سال پیش تکرار می کند. فشار رقابتی ناشی از عرضه GPT-6 OpenAI و موجی از مدلهای وزن باز سریع از چین، جدول زمانی همه را فشرده کرده است، و گوگل به وضوح سرعت را در سطح اسب بخار انتخاب میکند در حالی که مدلهای مرزی آن پرچم تحقیقات را دارند.
این که آیا رویکرد 3.8 Flash «سختتر کار میکند» - صرف توکنهای بیشتر برای استدلال چند مرحلهای سختگیرانه - در عمل کارآمدتر از مقیاس مدل خام است، در صورتحسابهای توسعهدهندگان در ماههای آینده نشان داده خواهد شد. معیارهای خود گوگل نشان می دهد که این تجارت می تواند به نفع تلاش باشد. بازار حکم خود را هر بار یک قبض API صادر می کند.
از هوش مصنوعی جلوتر بمانید
هر مدل عرضه، معیار و تغییر قیمت، در صورت وقوع ردیابی می شود — اخبار هوش مصنوعی بیشتر بخوانید →
