Google a lansat marți Gemini 3.8 Flash, cel mai nou model al său cal de bătaie poziționat drept cel mai bun sistem de raționament și codare al companiei, dar la același preț ca predecesorul său, alături de o variantă specializată numită Gemini 3.8 Flash Cyber, construită pentru munca defensivă de securitate cibernetică. Anunțul, publicat pe blogul oficial Google de către Tulsee Doshi, director senior de management de produs, și Raluca Ada Popa, lider de securitate Gemini la Google DeepMind, marchează cea de-a treia lansare Flash a Google în doar șase săptămâni.
Lansarea aterizează în mijlocul unui sezon de lansări neobișnuit de aglomerat și este un răspuns direct la presiunea de preț și performanță pe care rivalii au pus-o pe linia de modele Google. Pentru o perspectivă mai largă asupra modului în care laboratoarele de frontieră schimbă lovituri, echipa știri de ultimă oră urmărește fiecare lansare majoră a modelului pe măsură ce se întâmplă.
Două variante, o singură bază
Gemini 3.8 vine în două versiuni construite pe aceeași inteligență fundamentală. Gemini 3.8 Flash este calul de lucru pentru uz general: Google spune că oferă îmbunătățiri semnificative față de 3.7 Flash în inginerie software, sarcini agentice și raționament în mai mulți pași în domenii specializate, la același preț introductiv de 0,75 USD per milion de jetoane de intrare și 3,75 USD per milion de jetoane de ieșire.
Gemini 3.8 Flash Cyber este descris ca fiind cel mai capabil model de securitate cibernetică de la Google, cu ceea ce compania numește performanță la nivel de frontieră în detectarea vulnerabilităților și corecția automată. Spre deosebire de modelul standard Flash, nu este disponibil pe scară largă - Google îl distribuie unui set de apărători de încredere printr-un nou program numit Fairwind.
Potrivit postării pe blog, câștigurile de codificare și raționament în nucleul partajat au fost determinate parțial de pregătirea riguroasă în domeniul solicitant al securității cibernetice, iar ambele modele au fost accelerate de bucle agentice de lungă durată concepute pentru a evalua recursiv și a rafina modelele subiacente.
Criterii de referință: munciți mai din greu, nu doar deveniți mai mari
Pretențiile de referință ale Google se concentrează pe o filozofie de design pe care compania o rezumă clar: 3.8 Flash „lucrează mai greu”. Pe sarcini complexe, modelul execută pași suplimentari de raționament și apelează instrumente în mod iterativ, uneori consumând mai multe jetoane pentru a maximiza performanța la niveluri mai mari de efort. Dezvoltatorii pot reduce efortul pentru a reduce costurile de token sau pot rămâne pe Gemini 3.7 Flash, care rămâne pe deplin acceptat pentru sarcinile de lucru care primesc eficiență.
Rezultatele din titlu pe care Google le citează:
- DeepSWE v1.1 (ingineria software la orizont lung): 3.8 Flash depășește majoritatea modelelor de frontieră mai mari în rezolvarea autonomă a problemelor de inginerie complexe de la capăt la capăt, la ceea ce Google descrie ca o fracțiune din cost.
- Vals Finance Agent V2 și Harvey's Legal Agent Benchmark: 3.8 Flash depășește 3.7 Flash și alte modele de frontieră în domenii cantitative și profesionale care necesită analiză și raportare avansată.
- HLE-Verified: 3.8 Flash atinge 54,9%, pe care Google o prezintă ca dovadă a raționamentului în mai mulți pași în domeniile STEM, umaniste și profesionale.
Flash Cyber: Apărare împotriva infracțiunii
Varianta Cyber este versiunea mai neobișnuită. Google spune că a prioritizat în mod deliberat repararea vulnerabilităților față de capabilitățile ofensive precum exploatarea. Pe CWE-Bench, un benchmark extern de corecție condus de Collinear, Gemini 3.8 Flash Cyber a obținut o trecere@1 de 47,2% – chiar în spatele unui model de frontieră lider la 47,8%, conform Google, dar la un cost semnificativ mai mic, plasându-l pe frontiera Pareto a benchmark-ului.
Pe CyberGym, un standard de referință în industrie pentru găsirea vulnerabilităților, Google spune că modelul Cyber demonstrează descoperirea autonomă a vulnerabilităților la nivel de frontieră, depășind predecesorul său 3.5 Flash Cyber, precum și modelele de frontieră semnificativ mai mari. Pe benchmark-ul intern al Google care acoperă baze de cod complexe în 20 de limbaje de programare, modelul a atins o rată de succes care depășește 70%.
Securizează deja propriul cod Google
Google spune că modelul Cyber este deja implementat intern, iar exemplele pe care le oferă sunt specifice:
- Echipa de securitate Chrome a descoperit că 3.8 Flash Cyber a produs de 2,6 ori mai multe corecții corecte pentru vulnerabilitățile Chrome decât cele mai bune modele comerciale, care sunt mult mai mari.
- La firma de securitate Wiz, modelul a obținut o reamintire cu 7,5 până la 9,7 puncte procentuale mai mare la un etalon de testare internă de penetrare la un cost de 2,3 până la 5,2 ori mai mic în comparație cu alte modele de vârf de frontieră.
- Echipa Google Cloud Vulnerability Research a folosit modelul pentru a găsi o vulnerabilitate fundamentală critică în mai puțin de două ore - o clasă de vulnerabilități a cărei cercetare și descoperire, notează Google, durează de obicei luni de zile.
Ce înseamnă pentru dezvoltatori și piață
Pentru dezvoltatori, concluzia practică este stabilitatea prețurilor la capătul de jos al frontierei. Deținerea 3.8 Flash la prețul de lansare al lui 3.7 menține costul unui model competitiv de codare și agent la 0,75 USD/3,75 USD per milion de jetoane, un segment în care competitorii cu greutate deschisă și laboratoarele rivale au subcotat operatorii tradiționali tot anul. Mesajul Google este că cumpărătorii nu mai trebuie să aleagă între cost și capacitate la nivelul calului de muncă.
Modelul de distribuție a programului Fairwind pentru Flash Cyber este la fel de grăitor. Laboratoarele de prim rang tratează din ce în ce mai mult capacitatea de securitate cibernetică de elită ca pe ceva care trebuie să fie închis, mai degrabă decât să fie livrată la scară largă – oferind instrumente defensive de ultimă generație apărătorilor verificați, limitând în același timp potențialul de utilizare greșită ofensivă. Decizia Google de a acorda prioritate corecțiilor benchmark-urilor față de capacitățile de exploatare în antrenamentul modelului urmează aceeași logică.
Este notabilă și cadența. Trei lansări Flash în șase săptămâni — 3.7 Flash în urmă cu trei săptămâni, acum 3.8 — arată că Google își repetă linia de nivel mediu mult mai rapid decât ciclurile anuale de lansare de acum doi ani. Presiunea competitivă din lansarea GPT-6 a OpenAI și un val de modele cu greutate deschisă în mișcare rapidă din China au comprimat cronologia tuturor, iar Google alege în mod clar viteza la nivelul calului de muncă, în timp ce modelele sale de frontieră poartă steagul cercetării.
Dacă abordarea 3.8 Flash „funcționează mai greu” – cheltuind mai multe jetoane pentru raționamentul diligent în mai mulți pași – se dovedește mai eficientă în practică decât scara modelului brut va apărea în facturile dezvoltatorilor în următoarele luni. Valorile de referință proprii ale Google sugerează că comerțul poate favoriza diligența; piața își va da verdictul câte o factură API la un moment dat.
Rămâi înaintea AI
Fiecare lansare de model, referință și schimbare de preț, urmărită pe măsură ce se întâmplă — citește mai multe știri despre AI →
