أطلقت Google نظام Gemini 3.8 Flash يوم الثلاثاء، وهو أحدث طراز لها والذي تم تصنيفه كأفضل نظام تفكير وترميز للشركة حتى الآن بنفس سعر سابقه، إلى جانب متغير متخصص يسمى Gemini 3.8 Flash Cyber ​​مصمم لأعمال الأمن السيبراني الدفاعية. يمثل هذا الإعلان، الذي نشره تولسي دوشي، المدير الأول لإدارة المنتجات، ورالوكا أدا بوبا، مسؤول الأمن في Gemini في Google DeepMind، على مدونة Google الرسمية، الإصدار الثالث من برنامج Flash في ستة أسابيع فقط.

يتم الإطلاق في منتصف موسم إصدار مزدحم بشكل غير عادي، وهو بمثابة إجابة مباشرة لضغوط التسعير والأداء التي فرضها المنافسون على خط نماذج Google. للحصول على رؤية أوسع لكيفية تبادل الضربات بين المختبرات الحدودية، يتتبع فريق أخبار الذكاء الاصطناعي العاجلة كل إصدار رئيسي للنماذج لحظة حدوثه.

خياران مختلفان، كريم أساس واحد

يأتي Gemini 3.8 في نسختين مبنيتين على نفس الذكاء الأساسي. يعد Gemini 3.8 Flash العمود الفقري للأغراض العامة: تقول Google إنها تقدم تحسينات كبيرة على 3.7 Flash عبر هندسة البرمجيات والمهام الوكيلة والتفكير متعدد الخطوات في المجالات المتخصصة، بنفس السعر التمهيدي البالغ 0.75 دولارًا أمريكيًا لكل مليون رمز إدخال و3.75 دولارًا أمريكيًا لكل مليون رمز إخراج.

يوصف Gemini 3.8 Flash Cyber ​​بأنه نموذج الأمن السيبراني الأكثر قدرة من Google، مع ما تسميه الشركة الأداء على مستوى الحدود في اكتشاف الثغرات الأمنية والتصحيح الآلي. وعلى عكس نموذج Flash القياسي، فهو غير متاح على نطاق واسع، حيث تقوم Google بتوزيعه على مجموعة من المدافعين الموثوق بهم من خلال برنامج جديد يسمى Fairwind.

وفقًا لمنشور المدونة، كانت مكاسب الترميز والاستدلال عبر النواة المشتركة مدفوعة جزئيًا بالتدريب الصارم في مجال الأمن السيبراني المتطلب، وتم تسريع كلا النموذجين من خلال حلقات وكيلة طويلة الأمد مصممة لتقييم النماذج الأساسية وتحسينها بشكل متكرر.

المعايير: العمل بجدية أكبر، وليس مجرد النمو

تركز مطالبات Google المعيارية على فلسفة التصميم التي تلخصها الشركة بوضوح: 3.8 Flash "يعمل بجد أكبر". في المهام المعقدة، ينفذ النموذج خطوات تفكير إضافية ويستدعي الأدوات بشكل متكرر، ويستهلك أحيانًا المزيد من الرموز المميزة لتحقيق أقصى قدر من الأداء عند مستويات جهد أعلى. يمكن للمطورين بذل جهد كبير لخفض الحمل الرمزي، أو الاستمرار في استخدام Gemini 3.7 Flash، الذي يظل مدعومًا بالكامل لأحمال العمل ذات الكفاءة أولاً.

النتائج الرئيسية التي يستشهد بها Google:

  • DeepSWE v1.1 (هندسة البرمجيات ذات الأفق البعيد): 3.8 يتفوق Flash في الأداء على معظم النماذج الحدودية الأكبر حجمًا في حل المشكلات الهندسية المعقدة بشكل مستقل من البداية إلى النهاية، مقابل ما تصفه Google بأنه جزء صغير من التكلفة.
  • Vals Finance Agent V2 وHarvey's Legal Agent Benchmark: 3.8 Flash يتفوق على 3.7 Flash والنماذج الحدودية الأخرى في المجالات الكمية والمهنية التي تتطلب تحليلاً وإعداد تقارير متقدمة.
  • تم التحقق من HLE: يحقق 3.8 Flash نسبة 54.9%، والتي تقدمها Google كدليل على التفكير متعدد الخطوات عبر العلوم والتكنولوجيا والهندسة والرياضيات والمجالات المهنية.

فلاش سايبر: الدفاع عن الهجوم

الإصدار السيبراني هو الإصدار الأكثر غرابة. تقول Google إنها أعطت الأولوية عمدًا لإصلاح الثغرات الأمنية على حساب القدرات الهجومية مثل الاستغلال. في CWE-Bench، وهو معيار تصحيح خارجي تديره شركة Collinear، سجل Gemini 3.8 Flash Cyber ​​نجاحاً بنسبة 47.2% - خلف النموذج الحدودي الرائد بنسبة 47.8%، وفقًا لـ Google، ولكن بتكلفة أقل بكثير، مما وضعه على حدود Pareto للمقياس.

في CyberGym، وهو معيار صناعي قياسي للعثور على نقاط الضعف، تقول جوجل إن نموذج Cyber ​​يوضح اكتشاف الثغرات الأمنية على المستوى الحدودي، متجاوزًا سابقه 3.5 Flash Cyber ​​بالإضافة إلى نماذج حدودية أكبر بكثير. وفقًا لمعيار Google الداخلي الذي يشمل قواعد تعليمات برمجية معقدة في 20 لغة برمجة، وصل النموذج إلى معدل نجاح يتجاوز 70%.

تأمين التعليمات البرمجية الخاصة بشركة Google بالفعل

تقول جوجل إن النموذج السيبراني تم نشره داخليًا بالفعل، والأمثلة التي يقدمها محددة:

  • وجد فريق Chrome Security أن الإصدار 3.8 Flash Cyber ​​أنتج تصحيحات صحيحة لنقاط ضعف Chrome بمعدل 2.6 مرة أكثر من أفضل النماذج التجارية، والتي هي أكبر بكثير.
  • في شركة الأمن Wiz، حقق النموذج استدعاء أعلى بنسبة 7.5 إلى 9.7 نقطة مئوية وفقًا لمعيار اختبار الاختراق الداخلي وبتكلفة أقل بنسبة 2.3 إلى 5.2 مرة مقارنة بالنماذج الحدودية الرائدة الأخرى.
  • استخدم فريق أبحاث الثغرات الأمنية السحابية في Google هذا النموذج للعثور على ثغرة أمنية أساسية حرجة في أقل من ساعتين - وهي فئة من الثغرات الأمنية التي تلاحظ Google أن البحث عنها واكتشافها يستغرق عادةً أشهرًا.

ماذا يعني ذلك بالنسبة للمطورين والسوق

بالنسبة للمطورين، فإن الوجبات الجاهزة العملية هي استقرار الأسعار عند الطرف الأدنى من الحدود. إن الاحتفاظ بـ 3.8 Flash بالسعر التمهيدي 3.7 يحافظ على تكلفة نموذج الترميز والوكيل التنافسي عند 0.75 دولارًا أمريكيًا / 3.75 دولارًا أمريكيًا لكل مليون رمز مميز، وهو الجزء الذي كان فيه المنافسون ذوو الوزن المفتوح والمختبرات المنافسة يقومون بتقويض الشركات القائمة طوال العام. رسالة Google هي أن المشترين لم يعودوا بحاجة إلى الاختيار بين التكلفة والقدرة في مستوى العمود الفقري.

إن نموذج توزيع برنامج Fairwind لـ Flash Cyber ​​له نفس القدر من الأهمية. تتعامل المختبرات الأمامية بشكل متزايد مع قدرات النخبة في مجال الأمن السيبراني على أنها شيء يجب بوابته بدلاً من شحنه على نطاق واسع - مما يوفر أدوات دفاعية حديثة للمدافعين الذين تم فحصهم مع الحد من احتمالية سوء الاستخدام الهجومي. إن قرار Google بإعطاء الأولوية لتصحيح المعايير على إمكانات الاستغلال في تدريب النموذج يتبع نفس المنطق.

الإيقاع ملحوظ أيضًا. تظهر ثلاثة إصدارات Flash في ستة أسابيع - 3.7 Flash قبل ثلاثة أسابيع، والآن 3.8 - أن Google تكرر خط الطبقة المتوسطة بشكل أسرع بكثير من دورات الإصدار ذات النمط السنوي قبل عامين. أدى الضغط التنافسي الناجم عن طرح GPT-6 من OpenAI وموجة من النماذج ذات الوزن المفتوح سريعة الحركة من الصين إلى ضغط الجداول الزمنية للجميع، ومن الواضح أن جوجل تختار السرعة على مستوى العمود الفقري بينما تحمل نماذجها الحدودية راية البحث.

ما إذا كان نهج 3.8 Flash "يعمل بجدية أكبر" - إنفاق المزيد من الرموز المميزة على التفكير الدؤوب متعدد الخطوات - أثبت أنه أكثر كفاءة من الناحية العملية من ظهور مقياس النموذج الأولي في فواتير المطورين خلال الأشهر المقبلة. وتشير معايير جوجل الخاصة إلى أن التجارة يمكن أن تفضل الاجتهاد؛ سيصدر السوق حكمه على فاتورة API واحدة في كل مرة.

البقاء في صدارة الذكاء الاصطناعي

يتم تتبع كل إطلاق للنموذج، ومعيار القياس، وتغيير السعر فور حدوثه - اقرأ المزيد من أخبار الذكاء الاصطناعي →