Google DeepMind превратил использование компьютера во встроенный инструмент Gemini 3.5 Flash, предоставив разработчикам собственный способ создания агентов искусственного интеллекта, которые могут взаимодействовать с программным обеспечением на разных платформах, не прибегая к сторонним платформам.

В объявлении, опубликованном 24 июня 2026 года в официальном блоге Google Keyword, Gemini 3.5 Flash позиционируется как конкурент на быстро развивающемся рынке агентов, которые могут видеть экран, перемещать курсор, щелкать мышью и печатать — возможности, которые до недавнего времени требовали значительных специальных разработок. Подробнее об этой истории — в нашем последние разработки в ИИ.

«Использование компьютера теперь является встроенным инструментом Gemini 3.5 Flash для создания агентов, которые могут взаимодействовать между платформами», — написали в компании. Автором поста является Матео Кирос, менеджер по продукту Google DeepMind.

Как это работает

Использование компьютера позволяет модели управлять компьютером так же, как это делает человек: интерпретируя то, что отображается на экране, и выполняя такие действия, как нажатие, прокрутка и ввод текста. Встраивая эту возможность непосредственно в Gemini 3.5 Flash, а не предлагая ее как отдельный продукт, Google снижает барьер для разработчиков, которые хотят создавать агенты, которые перемещаются по реальным приложениям, веб-сайтам и операционным системам.

Согласно сообщению в блоге, разработчики и предприятия могут начать использовать компьютер в 3.5 Flash через Gemini API и Gemini Enterprise Agent Platform, специальную среду Google для создания и развертывания агентов в большом масштабе.

Google продемонстрировал возможности на конкретных примерах использования. В одном примере Gemini 3.5 Flash использовал компьютер для анализа самого приложения Gemini и возврата категоризированного списка функций. В другом случае модель проверяла собственную документацию на наличие проблем с доступностью — самоссылающаяся задача, намекающая на то, как агенты, использующие компьютер, однажды смогут помочь поддерживать программные экосистемы, на которых они работают.

Безопасность: состязательная подготовка и подход «глубокоэшелонированной защиты»

Наиболее значимой частью релиза может стать то, что Google сказал о безопасности. Агенты, работающие в реальных средах, уникально уязвимы к быстрому внедрению — атакам, при которых скрытые инструкции, встроенные в веб-страницу, электронное письмо или документ, заставляют агента предпринять непредусмотренные действия.

Google заявила, что использовала целевую состязательную подготовку для использования компьютера в Gemini 3.5 Flash, чтобы снизить эти риски. Компания также выпускает две дополнительные корпоративные системы безопасности, которые, по словам компании, позволяют организациям лучше контролировать действия своих агентов.

Применяя подход «глубокоэшелонированной защиты», Google призвал разработчиков сочетать эти функции с безопасной изолированной программной средой, непрерывной проверкой данных и строгим контролем доступа. Компания опубликовала дополнительные рекомендации в документации по передовым практикам для этой функции.

Это оформление имеет значение. Использование компьютера широко рассматривается как одна из наиболее опасных возможностей агента для развертывания, поскольку скомпрометированный агент может выполнять реальные действия внутри учетных записей и систем пользователя. Проводя состязательное обучение и многоуровневые меры безопасности, Google пытается успокоить корпоративных покупателей, которые не решаются передать управление курсором ИИ.

Почему использование компьютера становится полем битвы

Компьютерное использование Gemini 3.5 Flash началось в связи с тем, что крупные лаборатории искусственного интеллекта стремятся создать агентов, способных выполнять полезную работу, а не просто отвечать на вопросы. В конце 2024 года Anthropic представила Клоду инструмент для использования компьютера, и продукты OpenAI для операторов и агентов продвинулись в том же направлении. Если сделать эту возможность встроенной в быструю и экономичную модель, такую ​​​​как Flash, а не резервировать ее для премиального уровня, это сигнализирует о том, что Google хочет быстро превратить управление агентами в товар.

Выбор Flash сам по себе примечателен. Flash — это модель уровня эффективности Google, оптимизированная по скорости и стоимости. Встраивание использования компьютера туда, а не только в более крупную модель Pro, предполагает, что Google ожидает больших объемов рабочих нагрузок агентов, чувствительных к задержкам, — таких, которые автоматизируют повторяющиеся задачи в бизнес-программном обеспечении в большом масштабе.

В Google заявили, что уже видят, как клиенты повышают ценность использования компьютеров, хотя в сообщении в блоге не упоминаются конкретные коммерческие внедрения и не оцениваются количественные результаты.

Конкурентные ставки

Для разработчиков привлекательность встроенного инструмента для использования на компьютере очевидна: меньшее количество интеграций, которые нужно поддерживать, и один поставщик, отвечающий как за модель, так и за агентный уровень. Но это также усиливает зависимость от платформы Google — компромисс, который предприятия будут сравнивать с гибкостью независящих от модели структур агентов.

Этот релиз также обостряет более широкую напряженность в агентской экономике. Независимо разработанные шлюзы агентов с открытым исходным кодом, такие как платформа Lightport, которая обеспечивает совместимость с OpenAI нескольких поставщиков LLM, показывают, насколько велик спрос на портативную инфраструктуру агентов. Google делает ставку на то, что собственный, безопасный инструмент для использования на компьютере победит разработчиков, которые в противном случае объединили бы сторонние инструменты. По мере того, как модели обретают способность действовать на экранах, грань между ИИ-помощником и автономным оператором продолжает стираться, как и грань между прорывом в производительности и ответственностью за безопасность. Ответом Google на эту напряженность являются многоуровневые меры безопасности и состязательная подготовка. От того, будет ли этого достаточно, чтобы удовлетворить предприятия, не склонные к риску, будет зависеть, насколько быстро агенты, использующие компьютеры, перейдут от демонстрационных версий к ежедневному использованию.

Создавая Gemini 3.5 Flash, Google сделал четкую ставку: будущее искусственного интеллекта — это не просто модели, которые отвечают, но и модели, которые действуют — и компания хочет, чтобы разработчики создавали эти действующие модели на ее платформе.

---

Будьте в курсе ИИ

Последние новости, аналитика и прорывы в сфере ИИ — всё в одном месте.

Читать больше новостей об ИИ →