Во вторник Google выпустила Gemini 3.8 Flash, свою новейшую рабочую модель, позиционируемую как лучшая система рассуждения и кодирования компании, но по той же цене, что и ее предшественница, наряду со специализированным вариантом под названием Gemini 3.8 Flash Cyber, созданным для защитной работы в области кибербезопасности. Объявление, опубликованное в официальном блоге Google Тулси Доши, старшим директором по управлению продуктами, и Ралукой Адой Попа, руководителем службы безопасности Gemini в Google DeepMind, знаменует собой третий выпуск Flash Flash от Google всего за шесть недель.

Запуск состоялся в середине необычно насыщенного сезона релизов, и это прямой ответ на давление, которое конкуренты по цене и производительности оказали на модельный ряд Google. Чтобы получить более широкое представление о том, как передовые лаборатории обмениваются ударами, команда [последних новостей искусственного интеллекта] (https://aibuzzwire.news) отслеживает выпуск каждой крупной модели по мере его появления.

Два варианта, одна основа

Gemini 3.8 выпускается в двух версиях, основанных на одном и том же фундаментальном интеллекте. Gemini 3.8 Flash — это рабочая лошадка общего назначения: Google заявляет, что она обеспечивает значительные улучшения по сравнению с Flash 3.7 в разработке программного обеспечения, агентских задачах и многоэтапном рассуждении в специализированных областях при той же начальной цене в 0,75 доллара за миллион входных токенов и 3,75 доллара за миллион выходных токенов.

Gemini 3.8 Flash Cyber ​​описывается как самая мощная модель кибербезопасности Google, обладающая тем, что компания называет производительностью передового уровня в обнаружении уязвимостей и автоматическом исправлении. В отличие от стандартной модели Flash, она не является широко доступной — Google распространяет ее среди доверенных защитников через новую программу под названием Fairwind.

Согласно сообщению в блоге, успехи в кодировании и рассуждении в рамках общего ядра были частично обусловлены тщательным обучением в требовательной области кибербезопасности, а обе модели были ускорены за счет длительных агентных циклов, предназначенных для рекурсивной оценки и уточнения базовых моделей.

Контрольные показатели: работать усерднее, а не просто становиться больше

Заявления Google о тестах основаны на философии дизайна, которую компания ясно излагает: 3.8 Flash «работает усерднее». При выполнении сложных задач модель выполняет дополнительные шаги рассуждения и итеративно вызывает инструменты, иногда потребляя больше токенов для максимизации производительности при более высоких уровнях усилий. Разработчики могут сократить усилия, чтобы сократить накладные расходы на токены, или остаться на Gemini 3.7 Flash, который по-прежнему полностью поддерживается для рабочих нагрузок, ориентированных на эффективность.

Заголовок результатов, которые Google цитирует:

  • DeepSWE v1.1 (перспективная разработка программного обеспечения): 3.8 Flash превосходит большинство крупных передовых моделей в автономном комплексном решении сложных инженерных задач, что, по мнению Google, является лишь частью стоимости.
  • Vals Finance Agent V2 и Harvey's Legal Agent Benchmark: 3.8 Flash превосходит 3.7 Flash и другие передовые модели в количественных и профессиональных областях, требующих расширенного анализа и отчетности.
  • Проверено HLE: Flash 3.8 достигает 54,9%, что Google представляет как свидетельство многоэтапного рассуждения в STEM, гуманитарных и профессиональных областях.

Flash Cyber: защита от нападения

Вариант Cyber — более необычный релиз. Google заявляет, что намеренно отдает приоритет исправлению уязвимостей, а не наступательным возможностям, таким как эксплуатация. В CWE-Bench, внешнем тесте исправлений, проводимом Collinear, Gemini 3.8 Flash Cyber ​​набрал проход @ 1 в 47,2% — чуть ниже лидирующей модели с показателем в 47,8%, по данным Google, но при значительно меньших затратах, что поставило ее на границу Парето теста.

В CyberGym, стандартном отраслевом тесте для поиска уязвимостей, Google заявляет, что модель Cyber ​​демонстрирует автономное обнаружение уязвимостей на переднем уровне, превосходя своего предшественника 3.5 Flash Cyber, а также значительно более крупные передовые модели. По внутреннему тесту Google, охватывающему сложные кодовые базы на 20 языках программирования, показатель успеха модели превысил 70%.

Уже защищает собственный код Google

Google утверждает, что модель Cyber уже внедрена внутри компании, и примеры, которые она предоставляет, весьма конкретны:

  • Команда Chrome Security обнаружила, что 3.8 Flash Cyber ​​производит в 2,6 раза больше правильных исправлений уязвимостей Chrome, чем лучшие коммерческие модели, размер которых намного больше.
  • В охранной фирме Wiz эта модель показала на 7,5–9,7 процентных пункта более высокий уровень отзыва по результатам внутреннего тестирования на проникновение при меньших затратах в 2,3–5,2 раза по сравнению с другими ведущими передовыми моделями.
  • Команда Google по исследованию уязвимостей в облаках использовала эту модель, чтобы менее чем за два часа обнаружить критическую фундаментальную уязвимость — класс уязвимостей, исследование и обнаружение которых, как отмечает Google, обычно занимает месяцы.

Что это значит для разработчиков и рынка

Для разработчиков практическим выводом является стабильность цен на нижнем уровне границы. Удержание 3.8 Flash по начальной цене 3.7 сохраняет стоимость конкурентоспособной модели кодирования и агентирования на уровне 0,75/3,75 доллара за миллион токенов, сегмент, в котором конкуренты с открытым весом и конкурирующие лаборатории весь год обгоняли действующих игроков. Послание Google заключается в том, что покупателям больше не нужно выбирать между стоимостью и возможностями на уровне «рабочей лошадки».

Модель распространения Flash Cyber ​​в рамках программы Fairwind также показательна. Лаборатории на переднем уровне все чаще рассматривают элитные возможности кибербезопасности как нечто, что следует охранять, а не распространять широко, предоставляя самые современные защитные инструменты проверенным защитникам, одновременно ограничивая потенциал для наступательных злоупотреблений. Решение Google отдать приоритет исправлениям тестов над возможностями эксплуатации при обучении модели, следует той же логике.

Каденция тоже примечательна. Три выпуска Flash за шесть недель — 3.7 Flash три недели назад, теперь 3.8 — показывают, что Google обновляет свою линейку среднего уровня гораздо быстрее, чем годовые циклы выпуска двухлетней давности. Конкурентное давление, вызванное внедрением OpenAI GPT-6 и волной быстро развивающихся моделей с открытым весом из Китая, сжало сроки для всех, и Google явно выбирает скорость в качестве рабочей лошадки, в то время как ее передовые модели несут исследовательский флаг.

В ближайшие месяцы в счетах разработчиков появится информация о том, окажется ли подход 3.8 Flash «более интенсивной работы» — трата большего количества жетонов на тщательное многоэтапное рассуждение — на практике более эффективным, чем масштаб необработанной модели. Собственные тесты Google показывают, что сделка может способствовать усердию; рынок будет выносить свой вердикт по одному законопроекту API за раз.

Будьте впереди ИИ

Каждый выпуск модели, контрольный показатель и изменение цены отслеживаются по мере их возникновения — читать дальше новости AI →