We wtorek Google wypuściło Gemini 3.8 Flash, swój najnowszy model wołu pociągowego, uznawany za najlepszy system wnioskowania i kodowania firmy, a jednocześnie w tej samej cenie co jego poprzednik, wraz ze specjalistycznym wariantem o nazwie Gemini 3.8 Flash Cyber, stworzonym do zadań związanych z obronnym cyberbezpieczeństwem. Oświadczenie, opublikowane na oficjalnym blogu Google przez Tulsee Doshi, starszego dyrektora ds. zarządzania produktami, i Ralucę Adę Popa, kierownika ds. bezpieczeństwa Gemini w Google DeepMind, oznacza trzecią wersję Flash firmy Google w ciągu zaledwie sześciu tygodni.

Premiera następuje w środku niezwykle zatłoczonego sezonu wydawniczego i jest bezpośrednią odpowiedzią na presję dotyczącą cen i wydajności, jaką rywale wywierają na linię modeli Google. Aby uzyskać szerszy obraz tego, jak laboratoria graniczne wymieniają ciosy, zespół najnowszych wiadomości o sztucznej inteligencji śledzi na bieżąco każdą premierę większego modelu.

Dwa warianty, jeden fundament

Gemini 3.8 jest dostępny w dwóch wersjach zbudowanych w oparciu o tę samą podstawową inteligencję. Gemini 3.8 Flash to narzędzie ogólnego przeznaczenia: Google twierdzi, że zapewnia znaczne ulepszenia w porównaniu z wersją 3.7 Flash w zakresie inżynierii oprogramowania, zadań agentycznych i wieloetapowego rozumowania w wyspecjalizowanych domenach, przy tej samej cenie początkowej wynoszącej 0,75 dolara za milion tokenów wejściowych i 3,75 dolara za milion tokenów wyjściowych.

Gemini 3.8 Flash Cyber ​​jest opisywany jako najpotężniejszy model cyberbezpieczeństwa firmy Google, charakteryzujący się, jak twierdzi firma, pionierską wydajnością w wykrywaniu luk w zabezpieczeniach i automatycznym łataniu. W przeciwieństwie do standardowego modelu Flash, nie jest on powszechnie dostępny — Google rozprowadza go wśród zaufanych obrońców za pośrednictwem nowego programu o nazwie Fairwind.

Jak wynika z wpisu na blogu, usprawnienia w zakresie kodowania i rozumowania we współdzielonym rdzeniu wynikały częściowo z rygorystycznego szkolenia w wymagającej dziedzinie cyberbezpieczeństwa, a oba modele zostały przyspieszone dzięki długotrwałym pętlom agentycznym zaprojektowanym w celu rekursywnej oceny i udoskonalania podstawowych modeli.

Punkty odniesienia: pracuj ciężej, a nie tylko zwiększaj się

Twierdzenia Google dotyczące testów porównawczych skupiają się na filozofii projektowania, którą firma podsumowuje jasno: 3.8 Flash „pracuje ciężej”. W przypadku złożonych zadań model wykonuje dodatkowe etapy rozumowania i iteracyjnie wywołuje narzędzia, czasami zużywając więcej tokenów, aby zmaksymalizować wydajność przy wyższych poziomach wysiłku. Programiści mogą zmniejszyć obciążenie, aby zmniejszyć obciążenie tokena, lub pozostać przy wersji Gemini 3.7 Flash, która jest w pełni obsługiwana w przypadku obciążeń stawiających przede wszystkim na wydajność.

Nagłówki wyników, które Google cytuje:

  • DeepSWE v1.1 (inżynieria oprogramowania o długim horyzoncie): 3.8 Flash przewyższa większość większych modeli pionierskich w autonomicznym rozwiązywaniu kompleksowych problemów inżynieryjnych od początku do końca, przy cenie, którą Google określa jako ułamek kosztów.
  • Vals Finance Agent V2 i Harvey's Legal Agent Benchmark: 3,8 Flash osiąga lepsze wyniki niż 3,7 Flash i inne modele pionierskie w obszarach ilościowych i zawodowych wymagających zaawansowanej analizy i raportowania.
  • HLE-Verified: 3.8 Flash osiąga 54,9%, co Google przedstawia jako dowód wieloetapowego rozumowania w dziedzinach STEM, humanistycznych i zawodowych.

Flash Cyber: Obrona zamiast ataku

Wersja Cyber jest bardziej nietypową wersją. Google twierdzi, że celowo nadał naprawianie luk w zabezpieczeniach ponad możliwościami ofensywnymi, takimi jak wykorzystywanie. W CWE-Bench, zewnętrznym teście porównawczym dotyczącym poprawek prowadzonym przez firmę Collinear, Gemini 3.8 Flash Cyber ​​uzyskał wynik pozytywny na poziomie 1 na poziomie 47,2% — według Google tuż za wiodącym modelem z rynku, który uzyskał wynik 47,8%, ale przy znacznie niższym koszcie, co plasuje go na granicy Pareto testu porównawczego.

W CyberGym, standardowym branżowym benchmarku służącym do wyszukiwania luk w zabezpieczeniach, Google twierdzi, że model Cyber ​​demonstruje pionierskie autonomiczne wykrywanie luk w zabezpieczeniach, przewyższając swojego poprzednika 3.5 Flash Cyber, a także znacznie większe modele pionierskie. W wewnętrznym teście Google obejmującym złożone bazy kodu w 20 językach programowania model osiągnął wskaźnik powodzenia przekraczający 70%.

Już zabezpieczam własny kod Google

Google twierdzi, że model Cyber jest już wdrożony wewnętrznie, a podane przykłady są konkretne:

  • Zespół Chrome Security odkrył, że Flash Cyber ​​3.8 wygenerował 2,6 razy więcej poprawnych łat na luki w Chrome niż najlepsze modele komercyjne, które są znacznie większe.
  • W firmie ochroniarskiej Wiz model uzyskał o 7,5 do 9,7 punktów procentowych wyższą skuteczność wycofania z rynku w wewnętrznych testach penetracyjnych przy koszcie od 2,3 do 5,2 razy niższym w porównaniu z innymi czołowymi modelami pionierskimi.
  • Zespół Google zajmujący się badaniem luk w chmurze wykorzystał ten model do znalezienia krytycznej, podstawowej luki w czasie krótszym niż dwie godziny. Jest to klasa luk, której zbadanie i odkrycie, jak zauważa Google, zwykle zajmuje miesiące.

Co to oznacza dla deweloperów i rynku

Dla deweloperów praktycznym wnioskiem jest stabilność cen na dolnym krańcu granicy. Trzymanie 3.8 Flash przy początkowej cenie 3.7 utrzymuje koszt konkurencyjnego modelu kodowania i agenta na poziomie 0,75/3,75 dolara za milion tokenów, co stanowi segment, w którym rywale o otwartej wadze i konkurencyjne laboratoria przez cały rok podcinają ceny obecnych na rynku operatorów. Przesłanie Google jest takie, że kupujący nie muszą już wybierać między kosztem a możliwościami na poziomie „konia pociągowego”.

Równie wymowny jest model dystrybucji programu Fairwind dla programu Flash Cyber. Frontierowe laboratoria coraz częściej traktują elitarne możliwości w zakresie cyberbezpieczeństwa jako coś, co należy zabezpieczyć, a nie szeroko rozpowszechnić – zapewniając najnowocześniejsze narzędzia obronne sprawdzonym obrońcom, ograniczając jednocześnie potencjał ofensywnego nadużycia. Decyzja Google, aby w szkoleniu modelu przedłożyć testy porównawcze łatania nad możliwościami wykorzystania, jest zgodna z tą samą logiką.

Kadencja też jest godna uwagi. Trzy wydania Flasha w ciągu sześciu tygodni – trzy tygodnie temu 3.7 Flash, obecnie 3.8 – pokazują, że Google iteruje swoją linię produktów średniej klasy znacznie szybciej niż w przypadku rocznych cykli wydań sprzed dwóch lat. Presja konkurencyjna wynikająca z wdrożenia OpenAI GPT-6 i fala szybko zmieniających się modeli o otwartej wadze z Chin skompresowała ramy czasowe wszystkich, a Google wyraźnie wybiera prędkość na poziomie konia pociągowego, podczas gdy jego pionierskie modele noszą flagę badawczą.

To, czy podejście Flasha 3.8 „działa ciężej” – wydawanie większej liczby żetonów na sumienne, wieloetapowe rozumowanie – okaże się w praktyce skuteczniejsze, niż surowa skala modelu będzie widoczna w rachunkach programistów w nadchodzących miesiącach. Własne testy Google sugerują, że branża ta może sprzyjać staranności; rynek wyda swój werdykt po jednym rachunku API.

Wyprzedź sztuczną inteligencję

Śledzenie każdego wprowadzenia na rynek modelu, punktu odniesienia i zmiany ceny na bieżąco — przeczytaj więcej aktualności o sztucznej inteligencji →