Google v úterý spustil Gemini 3.8 Flash, svůj nejnovější tahounský model umístěný jako nejlepší systém uvažování a kódování společnosti, ale za stejnou cenu jako jeho předchůdce, spolu se specializovanou variantou nazvanou Gemini 3.8 Flash Cyber vytvořenou pro defenzivní práci v oblasti kybernetické bezpečnosti. Oznámení, které na oficiálním blogu Google zveřejnili Tulsee Doshi, vrchní ředitel produktového managementu, a Raluca Ada Popa, bezpečnostní vedoucí Gemini ve společnosti Google DeepMind, představuje třetí verzi Flash od Googlu za pouhých šest týdnů.
Uvedení na trh je uprostřed neobvykle přeplněné sezóny vydání a je přímou odpovědí na tlak na cenu a výkon, který konkurenti vyvinuli na modelovou řadu Google. Chcete-li získat širší pohled na to, jak hraniční laboratoře obchodují s údery, přelomové zprávy o AI tým sleduje každé vydání velkého modelu tak, jak k němu dojde.
Dvě varianty, jeden základ
Gemini 3.8 přichází ve dvou verzích postavených na stejné základní inteligenci. Gemini 3.8 Flash je univerzální dříč: Google říká, že přináší významná vylepšení oproti 3.7 Flash v softwarovém inženýrství, agentních úlohách a vícestupňovém uvažování ve specializovaných doménách za stejnou zaváděcí cenu 0,75 $ za milion vstupních tokenů a 3,75 $ za milion výstupních tokenů.
Gemini 3.8 Flash Cyber je popisován jako nejschopnější model kybernetické bezpečnosti společnosti Google s tím, co společnost nazývá hraničním výkonem při detekci zranitelnosti a automatizovaných opravách. Na rozdíl od standardního modelu Flash není široce dostupný – Google jej distribuuje řadě důvěryhodných obránců prostřednictvím nového programu s názvem Fairwind.
Podle blogového příspěvku byly zisky kódování a uvažování napříč sdíleným jádrem částečně řízeny přísným školením v náročné doméně kybernetické bezpečnosti a oba modely byly urychleny dlouhotrvajícími agentními smyčkami navrženými tak, aby rekurzivně vyhodnocovaly a zpřesňovaly základní modely.
Benchmarks: Pracovat tvrději, nejen se zvětšovat
Nároky Google na benchmark se soustředí na filozofii designu, kterou společnost jasně shrnuje: 3.8 Flash „pracuje tvrději“. U složitých úkolů model provádí další kroky uvažování a opakovaně volá nástroje, přičemž někdy spotřebuje více tokenů, aby se maximalizoval výkon při vyšších úrovních úsilí. Vývojáři mohou snížit své úsilí, aby snížili režii tokenů, nebo zůstat na Gemini 3.7 Flash, který zůstává plně podporován pro pracovní zátěže zaměřené na efektivitu.
Titulkové výsledky, které Google cituje:
- DeepSWE v1.1 (softwarové inženýrství s dlouhým horizontem): 3,8 Flash překonává většinu větších hraničních modelů v autonomním řešení složitých inženýrských problémů od začátku do konce, za to, co Google popisuje jako zlomek nákladů.
- Vals Finance Agent V2 a Harvey's Legal Agent Benchmark: 3,8 Flash překonává 3,7 Flash a další hraniční modely v kvantitativních a profesionálních oblastech vyžadujících pokročilou analýzu a reporting.
- HLE-Verified: 3.8 Flash dosahuje 54,9 %, což Google prezentuje jako důkaz vícestupňového uvažování napříč STEM, humanitními a profesními obory.
Flash Cyber: Obrana před útokem
Cyber varianta je více neobvyklé vydání. Google říká, že záměrně upřednostnil opravu zranitelnosti před útočnými schopnostmi, jako je zneužívání. Na CWE-Bench, externím patchovacím benchmarku provozovaném společností Collinear, Gemini 3.8 Flash Cyber dosáhl pass@1 47,2 % – podle Googlu těsně za předním hraničním modelem s 47,8 %, ale za výrazně nižší cenu, čímž se dostal na Paretovu hranici benchmarku.
Na CyberGym, standardním průmyslovém srovnávacím testu pro hledání zranitelností, Google říká, že model Cyber demonstruje autonomní zranitelnost na hraniční úrovni, čímž překonává svého předchůdce 3.5 Flash Cyber a také výrazně větší hraniční modely. V interním benchmarku Google zahrnujícím komplexní kódové báze ve 20 programovacích jazycích dosáhl model úspěšnosti přesahující 70 %.
Vlastní kód Google již zajišťujeme
Google říká, že kybernetický model je již interně nasazen a příklady, které poskytuje, jsou konkrétní:
– Tým zabezpečení Chrome zjistil, že 3.8 Flash Cyber vytvořil 2,6krát více správných oprav zranitelností Chrome než nejlepší komerční modely, které jsou mnohem větší.
- U bezpečnostní firmy Wiz tento model dosáhl o 7,5 až 9,7 procentních bodů vyššího stažení v interním penetračním testu při 2,3 až 5,2krát nižších nákladech ve srovnání s jinými předními hraničními modely.
– Tým Google Cloud Vulnerability Research použil tento model k nalezení kritické základní zranitelnosti za méně než dvě hodiny – třída zranitelnosti, jejíž výzkum a objev, poznamenává Google, obvykle trvá měsíce.
Co to znamená pro vývojáře a trh
Pro vývojáře je praktickým přínosem cenová stabilita na spodní hranici. Držení 3.8 Flash za zaváděcí cenu 3.7 udržuje náklady na konkurenční kódovací a agentní model na 0,75 $ / 3,75 $ za milion tokenů, což je segment, kde vyzyvatelé s otevřenou váhou a konkurenční laboratoře celý rok podbízejí stávající společnosti. Poselstvím společnosti Google je, že kupující již nemusí volit mezi cenou a schopnostmi na úrovni tahounů.
Distribuční model programu Fairwind pro Flash Cyber je stejně výmluvný. Laboratoře na předních úrovních stále více zacházejí se schopnostmi elitní kybernetické bezpečnosti jako s něčím, co je třeba spíše ohradit, než aby je široce rozesílalo – poskytují nejmodernější obranné nástroje prověřeným obráncům a zároveň omezují potenciál pro útočné zneužití. Rozhodnutí společnosti Google upřednostnit záplatovací benchmarky před možnostmi využití při školení modelu se řídí stejnou logikou.
Kadence je také pozoruhodná. Tři vydání Flash za šest týdnů – 3.7 Flash před třemi týdny, nyní 3.8 – ukazují, že Google iteruje svou střední řadu mnohem rychleji než roční cykly vydávání před dvěma lety. Konkurenční tlak zavádění OpenAI GPT-6 a vlna rychle se pohybujících modelů s otevřenou váhou z Číny zkomprimovala časové osy všech a Google jasně volí rychlost na úrovni dříče, zatímco jeho hraniční modely nesou vlajku výzkumu.
Zda se přístup 3.8 Flash „pracuje tvrději“ – utrácení více tokenů za pečlivé uvažování ve více krocích – se v praxi ukáže jako efektivnější, než se ukáže v účtech vývojářů v nadcházejících měsících. Vlastní benchmarky Google naznačují, že obchod může podporovat pečlivost; trh vynese svůj verdikt po jednom účtu API.
Udržujte si náskok před umělou inteligencí
Každé uvedení modelu, benchmark a změna ceny, sledováno, jak k němu dochází — přečtěte si další zprávy o AI →
