Google lanserade Gemini 3.8 Flash på tisdagen, dess nyaste arbetshästmodell positionerad som företagets bästa resonemang och kodningssystem men till samma pris som sin föregångare, tillsammans med en specialiserad variant som heter Gemini 3.8 Flash Cyber byggd för defensivt cybersäkerhetsarbete. Tillkännagivandet, publicerat på Googles officiella blogg av Tulsee Doshi, senior director of product management, och Raluca Ada Popa, Gemini säkerhetschef på Google DeepMind, markerar Googles tredje Flash-släpp på bara sex veckor.
Lanseringen landar mitt i en ovanligt fullsatt releasesäsong, och det är ett direkt svar på pris- och prestationspressen som rivalerna har lagt på Googles modelllinje. För att få en bredare bild av hur gränslaboratoriet handlar med slag, spårar teamet brytande AI-nyheter varje större modellsläpp när det händer.
Två varianter, en grund
Gemini 3.8 kommer i två versioner byggda på samma grundläggande intelligens. Gemini 3.8 Flash är den generella arbetshästen: Google säger att den levererar betydande förbättringar över 3,7 Flash för mjukvaruteknik, agentuppgifter och flerstegsresonemang inom specialiserade domäner, till samma introduktionspris på 0,75 USD per miljon indatatokens och 3,75 USD per miljon utdatatokens.
Gemini 3.8 Flash Cyber beskrivs som Googles mest kapabla cybersäkerhetsmodell, med vad företaget kallar prestanda på gränsnivå inom sårbarhetsdetektering och automatiserad patchning. Till skillnad från standard Flash-modellen är den inte allmänt tillgänglig - Google distribuerar den till en uppsättning pålitliga försvarare genom ett nytt program som heter Fairwind.
Enligt blogginlägget drevs kodnings- och resonemangsvinsterna över den delade kärnan delvis av rigorös utbildning inom den krävande domänen av cybersäkerhet, och båda modellerna accelererades av långvariga agentslingor utformade för att rekursivt utvärdera och förfina de underliggande modellerna.
Riktmärken: Arbeta hårdare, inte bara bli större
Googles benchmarkanspråk fokuserar på en designfilosofi som företaget sammanfattar klart: 3.8 Flash "jobbar hårdare." Vid komplexa uppgifter utför modellen extra resonemangssteg och anropar verktyg iterativt, ibland förbrukar fler tokens för att maximera prestanda vid högre ansträngningsnivåer. Utvecklare kan sänka ansträngningen för att minska token-overhead, eller stanna på Gemini 3.7 Flash, som fortfarande stöds fullt ut för effektiviteten i första hand.
Rubrikresultaten som Google citerar:
- DeepSWE v1.1 (mjukvaruutveckling med lång horisont): 3.8 Flash överträffar de flesta större frontier-modeller när det gäller att autonomt lösa komplexa tekniska problem från början till slut, till vad Google beskriver som en bråkdel av kostnaden.
- Vals Finance Agent V2 och Harvey's Legal Agent Benchmark: 3,8 Flash överträffar 3,7 Flash och andra frontiermodeller inom kvantitativa och professionella områden som kräver avancerad analys och rapportering.
- HLE-verifierad: 3,8 Flash uppnår 54,9 %, vilket Google presenterar som bevis på flerstegsresonemang inom STEM, humaniora och yrkesområden.
Flash Cyber: Defense Over Offense
Cyber-varianten är den mer ovanliga utgåvan. Google säger att det medvetet prioriterade sårbarhetskorrigering framför offensiva funktioner som exploatering. På CWE-Bench, ett externt riktmärke för patchning som drivs av Collinear, fick Gemini 3.8 Flash Cyber en pass@1 på 47,2 % – precis bakom en ledande frontier-modell på 47,8 %, enligt Google, men till en betydligt lägre kostnad, vilket placerade den på benchmarkens Pareto-gräns.
På CyberGym, ett standardriktmärke för branschen för att hitta sårbarheter, säger Google att Cyber-modellen demonstrerar autonom sårbarhetsupptäckt på gränsnivå, och överträffar dess föregångare 3.5 Flash Cyber såväl som betydligt större frontier-modeller. På Googles interna riktmärke som spänner över komplexa kodbaser i 20 programmeringsspråk nådde modellen en framgångsgrad på över 70 %.
Säkrar redan Googles egen kod
Google säger att Cyber-modellen redan är implementerad internt och att exemplen den ger är specifika:
- Chrome Security-teamet fann att 3.8 Flash Cyber producerade 2,6 gånger fler korrekta korrigeringar för Chrome-sårbarheter än de bästa kommersiella modellerna, som är mycket större.
- Hos säkerhetsföretaget Wiz uppnådde modellen 7,5 till 9,7 procentenheter högre återkallelse på ett internt penetrationstestningsbenchmark till 2,3 till 5,2 gånger lägre kostnad jämfört med andra ledande frontier-modeller.
Vad det betyder för utvecklare och marknaden
För utvecklare är prisstabilitet i den nedre delen av gränsen den praktiska takeawayen. Att hålla 3,8 Flash till 3,7:s inledande prissättning håller kostnaden för en konkurrenskraftig kodnings- och agentmodell på $0,75/$3,75 per miljon tokens, ett segment där öppenviktsutmanare och rivaliserande labb har underskridit de etablerade aktörerna hela året. Googles budskap är att köpare inte längre behöver välja mellan kostnad och kapacitet i arbetshästnivån.
Fairwind-programmets distributionsmodell för Flash Cyber är lika talande. Laboratorier på frontnivå behandlar i allt högre grad elitsäkerhetskapacitet som något som ska inhägnas snarare än att skickas brett – tillhandahåller toppmoderna defensiva verktyg till granskade försvarare samtidigt som risken för offensivt missbruk begränsas. Googles beslut att prioritera riktmärken för patchning framför utnyttjandemöjligheter i modellens utbildning följer samma logik.
Kadensen är också anmärkningsvärd. Tre Flash-släpp på sex veckor – 3.7 Flash för tre veckor sedan, nu 3.8 – visar att Google upprepar sin mellanklasslinje mycket snabbare än de årliga releasecyklerna för två år sedan. Konkurrenstrycket från OpenAI:s GPT-6-utrullning och en våg av snabbrörliga modeller med öppen vikt från Kina har komprimerat allas tidslinjer, och Google väljer helt klart hastighet på arbetshästnivån medan dess frontmodeller bär forskningsflaggan.
Huruvida 3.8 Flashs "jobbar hårdare" tillvägagångssätt – att spendera fler tokens på flitiga flerstegsresonemang – visar sig vara effektivare i praktiken än rå modellskala kommer att dyka upp i utvecklarnas räkningar under de kommande månaderna. Googles egna riktmärken tyder på att handeln kan gynna flit; marknaden kommer att avge sin dom en API-räkning i taget.
Ligg före AI
Varje modelllansering, benchmark och prisändring, spåras när de händer — läs mer AI-nyheter →
