Google DeepMind перетворив використання комп’ютера на вбудований інструмент у Gemini 3.5 Flash, даючи розробникам власний спосіб створювати агенти штучного інтелекту, які можуть взаємодіяти з програмним забезпеченням на різних платформах без використання сторонніх фреймворків.
Оголошення, опубліковане 24 червня 2026 року в офіційному блозі Google Keyword, позиціонує Gemini 3.5 Flash як конкурента на швидкозмінному ринку агентів, які можуть бачити екран, переміщати курсор, клацати та друкувати — можливості, які донедавна вимагали значної спеціальної розробки. For more context on this story, see our ongoing latest AI developments.
«Використання комп’ютера тепер є вбудованим інструментом у Gemini 3.5 Flash для створення агентів, які можуть взаємодіяти на різних платформах», — написала компанія. Автором публікації є Матео Кірос, менеджер із продуктів Google DeepMind.
Як це працює
Використання комп’ютера дозволяє моделі керувати комп’ютером так само, як і людина: інтерпретуючи те, що відображається на екрані, і виконуючи такі дії, як натискання, прокручування та введення тексту. Впроваджуючи цю функцію безпосередньо в Gemini 3.5 Flash, а не пропонуючи її як окремий продукт, Google знижує бар’єр для розробників, які хочуть створити агентів, які переміщуються в реальних програмах, веб-сайтах і операційних системах.
Відповідно до публікації в блозі, розробники та підприємства можуть почати використовувати комп’ютери у 3.5 Flash через Gemini API та Gemini Enterprise Agent Platform, спеціальне середовище Google для створення та розгортання агентів у масштабі.
Google продемонстрував можливості на конкретних сценаріях використання. В одному прикладі Gemini 3.5 Flash використовував комп’ютер для аналізу самої програми Gemini та повернення категоризованого списку функцій. В іншому випадку модель перевірила власну документацію на предмет проблем із доступністю — самопосилання на завдання, яке натякає на те, як агенти, які використовують комп’ютер, одного разу можуть допомогти підтримувати програмні екосистеми, на яких вони працюють.
Безпека: змагальні тренування та підхід «поглибленого захисту»
Найбільш значущою частиною випуску може бути те, що Google сказав про безпеку. Агенти, які працюють у реальному середовищі, унікально вразливі до оперативних ін’єкцій — атак, під час яких приховані інструкції, вбудовані у веб-сторінку, електронний лист або документ, змушують агента виконувати ненавмисні дії.
Google заявив, що для пом’якшення цих ризиків використовував цілеспрямований тренінг із змагальності для використання комп’ютера в Gemini 3.5 Flash. Компанія також випускає дві додаткові корпоративні системи захисту, які, за словами компанії, дозволяють організаціям краще контролювати дії їхніх агентів.
Застосовуючи підхід «поглибленого захисту», Google заохочував розробників поєднувати ці функції з безпечним ізольованим програмним середовищем, перевіркою людиною в циклі та суворим контролем доступу. Компанія опублікувала додаткові вказівки у своїй документації щодо найкращих практик щодо цієї функції.
Це кадрування має значення. Використання комп’ютера широко розглядається як одна з найнебезпечніших агентських можливостей для розгортання, оскільки скомпрометований агент може виконувати реальні дії в облікових записах і системах користувача. Проводячи змагальні тренінги та багаторівневі заходи захисту, Google намагається заспокоїти корпоративних покупців, які вагалися передати керування курсором штучному інтелекту.
Чому використання комп'ютера стає полем битви
Використання комп’ютера Gemini 3.5 Flash з’являється в той момент, коли великі лабораторії ШІ намагаються створити агентів, які могли б виконувати корисну роботу, а не просто відповідати на запитання. Наприкінці 2024 року компанія Anthropic представила інструмент для використання комп’ютера для Клода, а продукти OpenAI для операторів і агентів рухаються в тому ж напрямку. Перетворення цієї можливості на швидку та економічно ефективну модель, як-от Flash, замість того, щоб зарезервувати її для преміум-рівня, свідчить про те, що Google хоче швидко перетворити агентський контроль на товар.
Вибір Flash сам по собі примітний. Flash — це модель рівня ефективності Google, оптимізована для швидкості та вартості. Вбудоване використання комп’ютера тут, а не лише у більшій моделі Pro, свідчить про те, що Google очікує великого обсягу робочих навантажень агентів, чутливих до затримок — таких, які автоматизують повторювані завдання в бізнес-програмному забезпеченні в масштабі.
У Google заявили, що вже бачать, що клієнти підвищують цінність завдяки використанню комп’ютера, хоча в дописі в блозі не згадуються конкретні комерційні впровадження чи кількісні показники результатів.
Конкурентні ставки
Для розробників привабливість вбудованого інструменту для використання комп’ютера проста: менше інтеграцій для підтримки та єдиний постачальник, відповідальний як за модель, так і за агентський рівень. Але це також поглиблює залежність від платформи Google, компроміс, який підприємства будуть зважувати проти гнучкості фреймворків агентів, що не залежать від моделей.
Випуск також посилює ширшу напругу в агентській економіці. Незалежно розроблені агентські шлюзи з відкритим вихідним кодом, такі як структура Lightport, яка робить кількох LLM-провайдерів сумісними з OpenAI, показують, наскільки великий попит існує на портативну агентську інфраструктуру. Google робить ставку на те, що надійний інструмент для використання на комп’ютері від першої сторони виграє розробників, які б інакше з’єднали інструменти сторонніх розробників. У міру того, як моделі отримують можливість діяти на екранах, межа між помічником штучного інтелекту та автономним оператором продовжує стиратися, а також межа між проривом у продуктивності та порушенням безпеки. Відповіддю Google на цю напругу є пошарові гарантії та змагальність. Від того, чи буде цього достатньо, щоб задовольнити ризиковані підприємства, залежатиме, наскільки швидко агенти, що використовують комп’ютери, перейдуть від демонстраційних версій до щоденного використання.
З Gemini 3.5 Flash компанія Google зробила чітку ставку: майбутнє штучного інтелекту — це не лише моделі, які відповідають, а моделі, які діють — і компанія хоче, щоб розробники створювали ці діючі моделі на своїй платформі.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →


