У вівторок Google випустив Gemini 3.8 Flash, свою нову модель «робочої конячки», яка позиціонується як найкраща система міркувань і кодування компанії, але за тією ж ціною, що й її попередник, поряд із спеціалізованим варіантом під назвою Gemini 3.8 Flash Cyber, створеним для оборонної роботи з кібербезпеки. Оголошення, опубліковане в офіційному блозі Google Tulsee Doshi, старшим директором з управління продуктами, і Raluca Ada Popa, керівником безпеки Gemini в Google DeepMind, знаменує третій випуск Google Flash лише за шість тижнів.

Запуск відбувається посеред надзвичайно насиченого сезону випусків, і це пряма відповідь на тиск, який конкуренти чинили на лінійку моделей Google з точки зору цін і продуктивності. Щоб отримати ширше уявлення про те, як передові лабораторії обмінюються ударами, команда найновіших новин штучного інтелекту відстежує випуск кожної великої моделі.

Два варіанти, одна основа

Gemini 3.8 доступний у двох версіях, побудованих на тому самому базовому інтелекті. Gemini 3.8 Flash — це робоча конячка загального призначення: Google каже, що він забезпечує значні покращення порівняно з 3.7 Flash у розробці програмного забезпечення, агентських завданнях і багатоетапному обґрунтуванні в спеціалізованих доменах за тією самою початковою ціною 0,75 доларів США за мільйон вхідних токенів і 3,75 доларів США за мільйон вихідних токенів.

Gemini 3.8 Flash Cyber ​​описується як найефективніша модель кібербезпеки Google із тим, що компанія називає граничним рівнем продуктивності у виявленні вразливостей і автоматичному виправленні. На відміну від стандартної моделі Flash, він не є широкодоступним — Google поширює його серед надійних захисників за допомогою нової програми під назвою Fairwind.

Відповідно до допису в блозі, покращення кодування та міркування в спільному ядрі було частково зумовлено суворим навчанням у вимогливій сфері кібербезпеки, і обидві моделі були прискорені тривалими агентськими циклами, призначеними для рекурсивної оцінки та вдосконалення базових моделей.

Контрольні показники: працювати більше, а не просто ставати більшим

Порівняльні вимоги Google зосереджені на філософії дизайну, яку компанія чітко підсумовує: 3.8 Flash «працює більше». У складних завданнях модель виконує додаткові кроки обґрунтування та ітераційно викликає інструменти, іноді споживаючи більше токенів, щоб максимізувати продуктивність на вищих рівнях зусиль. Розробники можуть докласти зусиль, щоб скоротити накладні витрати на маркери, або залишитися на Gemini 3.7 Flash, який, як і раніше, повністю підтримується для робочих навантажень, орієнтованих на ефективність.

Результати заголовка, які цитує Google:

  • DeepSWE v1.1 (розробка програмного забезпечення з великим горизонтом): 3.8 Flash перевершує більшість більших передових моделей у автономному вирішенні складних інженерних проблем від кінця до кінця, що Google описує як частку вартості.
  • Vals Finance Agent V2 і Harvey's Legal Agent Benchmark: 3.8 Flash перевершує 3.7 Flash та інші передові моделі в кількісних і професійних сферах, що вимагають розширеного аналізу та звітності.
  • HLE-Verified: 3.8 Flash досягає 54,9%, що Google представляє як доказ багатоетапного обґрунтування в STEM, гуманітарних і професійних сферах.

Flash Cyber: захист над нападом

Варіант Cyber є більш незвичайним випуском. Google стверджує, що навмисно віддав пріоритет усуненню вразливостей, а не таким агресивним можливостям, як експлуатація. На CWE-Bench, зовнішньому тесті виправлення, який проводить Collinear, Gemini 3.8 Flash Cyber ​​набрав результат @1 у 47,2% — за даними Google трохи поступаючись передовій моделі з показником 47,8%, але за значно нижчою ціною, що поставило його на межу Парето в цьому тесті.

На CyberGym, стандартному галузевому тесті для пошуку вразливостей, Google каже, що модель Cyber ​​демонструє автономне виявлення вразливостей на передньому рівні, перевершуючи свого попередника 3.5 Flash Cyber, а також значно більші передові моделі. У внутрішньому тестуванні Google, що охоплює складні кодові бази на 20 мовах програмування, показник успішності моделі перевищив 70%.

Уже захищено власний код Google

Google каже, що модель Cyber вже розгорнута всередині країни, і приклади, які вона надає, є конкретними:

– Команда Chrome Security виявила, що 3.8 Flash Cyber ​​створила в 2,6 рази більше правильних виправлень для вразливостей Chrome, ніж найкращі комерційні моделі, які набагато більші.

  • У охоронній фірмі Wiz ця модель досягла на 7,5-9,7 відсоткових пунктів більшої відкликаності за тестом внутрішнього тестування на проникнення при нижчій вартості в 2,3-5,2 рази порівняно з іншими провідними передовими моделями.

  • Команда дослідження хмарних вразливостей Google використала модель, щоб знайти критичну фундаментальну вразливість менш ніж за дві години — клас уразливості, дослідження та виявлення якої, зазначає Google, зазвичай займає місяці.

Що це означає для розробників і ринку

Для розробників практичним висновком є стабільність цін на нижньому межі. Тримаючи 3.8 Flash за початковою ціною 3.7, вартість конкурентоспроможної моделі кодування та агентування зберігається на рівні 0,75/3,75 доларів США за мільйон токенів, сегмент, де претенденти з відкритою вагою та конкурентні лабораторії цілий рік підривають конкурентів. Повідомлення Google полягає в тому, що покупцям більше не потрібно вибирати між ціною та можливостями на рівні робочої конячки.

Модель розповсюдження програми Fairwind для Flash Cyber ​​також показова. Передові лабораторії дедалі частіше сприймають елітні можливості кібербезпеки як щось, що має бути закритим, а не широкомасштабним, надаючи перевіреним захисникам найсучасніші захисні інструменти, одночасно обмежуючи потенціал неправомірного використання. Рішення Google надати пріоритет тестам виправлення над можливостями експлуатації під час навчання моделі слідує тій самій логіці.

Каденція теж помітна. Три випуски Flash за шість тижнів — 3.7 Flash три тижні тому, тепер 3.8 — показує, що Google ітерує свою лінію середнього рівня набагато швидше, ніж щорічні цикли випусків два роки тому. Конкурентний тиск з боку розгортання OpenAI GPT-6 і хвилі швидких моделей відкритої ваги з Китаю стисли часові рамки для всіх, і Google явно обирає швидкість на рівні робочої конячки, тоді як її передові моделі несуть прапор досліджень.

Чи підхід 3.8 Flash «працює більше» — витрачати більше токенів на ретельне багатоетапне обґрунтування — виявиться ефективнішим на практиці, ніж сирий масштаб моделі, буде показано в рахунках розробників протягом наступних місяців. Власні тести Google показують, що торгівля може віддати перевагу старанності; ринок виносить свій вердикт по одному законопроекту за API.

Будьте попереду ШІ

Кожен запуск моделі, еталонний показник і зміна ціни відстежуються по мірі виникнення — читайте більше новин AI →