Google Salı günü, şirketin en iyi muhakeme ve kodlama sistemi olarak konumlandırılan en yeni güçlü modeli Gemini 3.8 Flash'ı, defansif siber güvenlik çalışmaları için tasarlanmış Gemini 3.8 Flash Cyber ​​adlı özel bir varyantın yanı sıra selefiyle aynı fiyata piyasaya sürdü. Ürün yönetiminden sorumlu kıdemli direktör Tulsee Doshi ve Google DeepMind Gemini güvenlik lideri Raluca Ada Popa tarafından Google'ın resmi blogunda yayınlanan duyuru, Google'ın yalnızca altı hafta içindeki üçüncü Flash sürümünü işaret ediyor.

Lansman, alışılmadık derecede kalabalık bir yayın sezonunun ortasında gerçekleşiyor ve bu, rakiplerin Google'ın model serisine uyguladığı fiyat ve performans baskısına doğrudan bir yanıt. Sınır laboratuvarlarının nasıl darbeler aldığına dair daha geniş bir bakış açısı için son dakika yapay zeka haberleri ekibi, her önemli modelin çıkışını anında takip ediyor.

İki Varyant, Tek Temel

Gemini 3.8 aynı temel zeka üzerine kurulu iki versiyonla geliyor. Gemini 3.8 Flash, genel amaçlı bir çalışma aracıdır: Google, bir milyon giriş tokenı başına 0,75 ABD Doları ve bir milyon çıkış tokenı başına 3,75 ABD Doları tutarındaki aynı başlangıç ​​fiyatıyla, yazılım mühendisliği, aracılık görevleri ve özel alanlarda çok adımlı akıl yürütmede 3,7 Flash'a göre önemli iyileştirmeler sağladığını söylüyor.

Gemini 3.8 Flash Cyber, şirketin güvenlik açığı tespiti ve otomatik yama uygulama konusunda sınır düzeyinde performans olarak adlandırdığı performansla Google'ın en yetenekli siber güvenlik modeli olarak tanımlanıyor. Standart Flash modelinin aksine, geniş çapta mevcut değildir; Google, bunu Fairwind adlı yeni bir program aracılığıyla bir dizi güvenilir savunucuya dağıtmaktadır.

Blog gönderisine göre, paylaşılan çekirdekteki kodlama ve muhakeme kazanımları kısmen zorlu siber güvenlik alanındaki sıkı eğitimden kaynaklandı ve her iki model de, temeldeki modelleri yinelemeli olarak değerlendirmek ve iyileştirmek için tasarlanan uzun vadeli aracı döngüler tarafından hızlandırıldı.

Karşılaştırmalar: Daha Çok Çalışmak, Sadece Büyümek Değil

Google'ın referans iddiaları, şirketin açıkça özetlediği bir tasarım felsefesine odaklanıyor: 3.8 Flash "daha çok çalışır." Karmaşık görevlerde model, ekstra muhakeme adımları yürütür ve araçları yinelemeli olarak çağırır; bazen daha yüksek çaba seviyelerinde performansı en üst düzeye çıkarmak için daha fazla belirteç tüketir. Geliştiriciler, belirteç yükünü azaltmak için çabayı azaltabilir veya verimliliği ön planda tutan iş yükleri için tam olarak desteklenen Gemini 3.7 Flash'ı kullanmaya devam edebilir.

Google'ın aktardığı başlık sonuçları:

  • DeepSWE v1.1 (uzun ufuklu yazılım mühendisliği): 3.8 Flash, Google'ın maliyetin çok küçük bir kısmı olarak tanımladığı şekilde, karmaşık mühendislik sorunlarını uçtan uca bağımsız olarak çözmede daha büyük öncü modellerin çoğundan daha iyi performans gösterir.
  • Vals Finance Agent V2 ve Harvey's Legal Agent Benchmark: 3.8 Flash, gelişmiş analiz ve raporlama gerektiren niceliksel ve profesyonel alanlarda 3.7 Flash ve diğer sınır modellerinden daha iyi performans gösterir.
  • HLE Onaylı: 3,8 Flash %54,9'a ulaştı; Google bunu STEM, beşeri bilimler ve profesyonel alanlarda çok adımlı akıl yürütmenin kanıtı olarak sunuyor.

Flash Cyber: Saldırıdan Çok Savunma

Cyber ​​varyantı daha sıra dışı sürümdür. Google, istismar gibi saldırı yetenekleri yerine güvenlik açığı düzeltmesine kasıtlı olarak öncelik verdiğini söylüyor. Gemini 3.8 Flash Cyber, Collinear tarafından yürütülen harici bir yama testi olan CWE-Bench'te %47,2'lik bir pass@1 puanı elde etti; Google'a göre %47,8'lik lider sınır modelinin hemen arkasında, ancak önemli ölçüde daha düşük bir maliyetle, karşılaştırmanın Pareto sınırına yerleşti.

Google, güvenlik açıklarını bulmak için standart bir sektör ölçütü olan CyberGym'de, Cyber ​​modelinin öncül 3.5 Flash Cyber'ın yanı sıra önemli ölçüde daha büyük sınır modellerini geride bırakarak sınır düzeyinde özerk güvenlik açığı keşfi gösterdiğini söylüyor. Google'ın 20 programlama dilindeki karmaşık kod tabanlarını kapsayan dahili karşılaştırmasında model %70'i aşan bir başarı oranına ulaştı.

Zaten Google'ın Kendi Kodunun Güvenliği Sağlanıyor

Google, Siber modelin halihazırda dahili olarak dağıtıldığını ve sağladığı örneklerin spesifik olduğunu söylüyor:

  • Chrome Güvenlik ekibi, 3.8 Flash Cyber'ın Chrome güvenlik açıklarına yönelik, çok daha büyük olan en iyi ticari modellere göre 2,6 kat daha fazla doğru yama ürettiğini buldu.
  • Güvenlik firması Wiz'de model, diğer öncü modellerle karşılaştırıldığında 2,3 ila 5,2 kat daha düşük maliyetle, dahili bir sızma testi kıyaslamasında yüzde 7,5 ila 9,7 puan daha yüksek geri çağırma elde etti.
  • Google'ın Bulut Güvenlik Açığı Araştırma ekibi, iki saatten kısa bir sürede kritik bir temel güvenlik açığı bulmak için modeli kullandı; Google, araştırması ve keşfinin genellikle aylar sürdüğünü belirtiyor.

Geliştiriciler ve Pazar İçin Ne İfade Ediyor?

Geliştiriciler için pratik çıkarım, sınırın alt ucundaki fiyat istikrarıdır. 3.8 Flash'ı 3.7'nin başlangıç ​​fiyatında tutmak, rekabetçi bir kodlama ve ajan modelinin maliyetini milyon token başına 0,75 $/3,75 $ seviyesinde tutuyor; bu, açık ağırlık rakiplerinin ve rakip laboratuvarların tüm yıl boyunca yerleşik şirketlerin altını çizdiği bir segment. Google'ın mesajı, alıcıların artık yüksek performans seviyesinde maliyet ve yetenek arasında seçim yapmasına gerek olmadığı yönünde.

Flash Cyber ​​için Fairwind Programı dağıtım modeli de aynı derecede anlamlıdır. Ön kademe laboratuvarları, elit siber güvenlik kabiliyetini geniş çapta göndermek yerine, kontrol edilmesi gereken bir şey olarak giderek daha fazla ele alıyor; incelenen savunuculara en son teknolojiye sahip savunma araçları sağlarken, saldırı amaçlı suiistimal potansiyelini de sınırlıyor. Google'ın, modelin eğitiminde kullanım yetenekleri yerine yama kıyaslamalarına öncelik verme kararı da aynı mantığı takip ediyor.

Kadansı da dikkat çekicidir. Altı haftada üç Flash sürümü (üç hafta önce 3,7 Flash, şimdi 3,8) Google'ın orta seviye çizgisini iki yıl önceki yıllık sürüm döngülerinden çok daha hızlı yinelediğini gösteriyor. OpenAI'nin GPT-6 sunumundan kaynaklanan rekabet baskısı ve Çin'den gelen hızlı hareket eden açık ağırlıklı model dalgası, herkesin zaman çizelgelerini sıkıştırdı ve Google, öncü modelleri araştırma bayrağını taşırken, açık bir şekilde işgücü seviyesinde hızı seçiyor.

3.8 Flash'ın "daha sıkı çalışır" yaklaşımının (çok adımlı muhakeme için daha fazla jeton harcamak) pratikte ham model ölçeğinden daha etkili olup olmadığı önümüzdeki aylarda geliştiricilerin faturalarında görünecek. Google'ın kendi kriterleri, ticaretin titizliği destekleyebileceğini gösteriyor; Piyasa her seferinde bir API faturasıyla kararını verecek.

Yapay Zekanın Önünde Kalın

Her modelin piyasaya sürülmesi, kıyaslama ve fiyat değişimi gerçekleştikçe takip edilir — daha fazla AI haberini okuyun →