Google DeepMind proměnil používání počítače na vestavěný nástroj v Gemini 3.5 Flash, což vývojářům poskytuje nativní způsob, jak vytvářet agenty umělé inteligence, kteří mohou interagovat se softwarem napříč platformami, aniž by museli používat rámce třetích stran.

Oznámení, zveřejněné 24. června 2026 na oficiálním blogu klíčových slov Google, staví Gemini 3.5 Flash jako uchazeče na rychle se měnícím trhu pro agenty, kteří mohou vidět obrazovku, pohybovat kurzorem, klikat a psát – schopnosti, které až donedávna vyžadovaly značné vlastní inženýrství. For more context on this story, see our ongoing latest AI developments.

"Použití počítače je nyní vestavěným nástrojem v Gemini 3.5 Flash pro vytváření agentů, kteří mohou interagovat napříč platformami," napsala společnost. Autorem příspěvku je Mateo Quiros, produktový manažer Google DeepMind.

Jak to funguje

Použití počítače umožňuje modelu ovládat počítač podobně jako člověk: interpretací toho, co je na obrazovce, a prováděním akcí, jako je klikání, rolování a zadávání textu. Tím, že Google tuto schopnost zapíchl přímo do Gemini 3.5 Flash, místo aby ji nabízel jako samostatný produkt, snižuje bariéru pro vývojáře, kteří chtějí vytvářet agenty, kteří procházejí skutečnými aplikacemi, weby a operačními systémy.

Podle příspěvku na blogu mohou vývojáři a podniky začít používat počítač ve verzi 3.5 Flash prostřednictvím rozhraní Gemini API a platformy Gemini Enterprise Agent Platform, vyhrazeného prostředí společnosti Google pro vytváření a nasazování agentů ve velkém.

Google tuto schopnost demonstroval na konkrétních případech použití. V jednom příkladu Gemini 3.5 Flash použil počítač k analýze samotné aplikace Gemini a vrátil kategorizovaný seznam funkcí. V jiném model provedl audit své vlastní dokumentace kvůli problémům s přístupností – což je samo-referenční úkol, který naznačuje, jak by agenti používající počítače jednoho dne mohli pomáhat udržovat softwarové ekosystémy, na kterých běží.

Bezpečnost: Výcvik protivníků a přístup „hloubkové obrany“.

Nejdůležitější částí vydání může být to, co Google řekl o bezpečnosti. Agenti, kteří pracují v živých prostředích, jsou jedinečně zranitelní vůči rychlému vložení – útokům, při kterých skryté pokyny vložené do webové stránky, e-mailu nebo dokumentu unesou agenta, aby provedl nezamýšlené akce.

Google uvedl, že ke zmírnění těchto rizik použil cílené školení protivníků pro používání počítače v Gemini 3.5 Flash. Uvolňuje také dva volitelné podnikové ochranné systémy, které podle společnosti umožňují organizacím lépe kontrolovat, co mohou jejich agenti dělat.

Na základě přístupu „hloubkové ochrany“ Google vyzval vývojáře, aby tyto funkce zkombinovali s bezpečným sandboxingem, ověřováním člověkem ve smyčce a přísnými kontrolami přístupu. Společnost zveřejnila další pokyny ve své dokumentaci osvědčených postupů pro tuto funkci.

Na tom rámování záleží. Používání počítače je široce považováno za jednu z nejnebezpečnějších schopností agenta pro nasazení, protože kompromitovaný agent může provádět akce v reálném světě uvnitř účtů a systémů uživatele. Tím, že vede školení protivníků a vrstvená ochranná opatření, se Google snaží uklidnit podnikové kupující, kteří váhali s ručním ovládáním kurzoru AI.

Proč se používání počítače stává bojištěm

Používání počítače Gemini 3.5 Flash přichází v době, kdy se hlavní laboratoře umělé inteligence předhánějí ve výrobě agentů, kteří mohou dělat užitečnou práci, než jen odpovídat na otázky. Anthropic představil nástroj pro používání počítače pro Claude na konci roku 2024 a produkty operátora a agenta OpenAI se vydaly stejným směrem. Vytvoření funkce nativní pro rychlý a cenově výhodný model, jako je Flash – namísto jejího vyhrazení pro prémiovou úroveň – signalizuje, že Google chce rychle komoditizovat kontrolu agentů.

Samotný výběr Flash je pozoruhodný. Flash je model společnosti Google na úrovni efektivity, optimalizovaný pro rychlost a cenu. Začlenění používání počítačů tam, spíše než pouze do většího modelu Pro, naznačuje, že Google očekává velké objemy práce agentů citlivých na latenci – takové, které automatizují opakující se úkoly napříč podnikovým softwarem ve velkém.

Google uvedl, že již vidí, že zákazníci zvyšují hodnotu používáním počítačů, ačkoli blogový příspěvek neuvádí konkrétní komerční nasazení ani nekvantifikuje výsledky.

Konkurenční sázky

Pro vývojáře je přitažlivost vestavěného nástroje pro používání počítače přímočará: méně integrací, které je třeba udržovat, a jediný dodavatel odpovědný za model i za agentskou vrstvu. Ale také to prohlubuje závislost na platformě Google, což je kompromis, který budou podniky porovnávat s flexibilitou rámců agentů agnostických modelů.

Zveřejnění také vyostřuje širší napětí v ekonomice agentů. Nezávisle vyvinuté brány agentů s otevřeným zdrojovým kódem, jako je framework Lightport, díky kterému je více poskytovatelů LLM kompatibilní s OpenAI, ukazují, jak velká je poptávka po infrastruktuře přenosných agentů. Google sází na to, že počítačový nástroj první strany, který je odolnější vůči bezpečnosti, zvítězí nad vývojáři, kteří by jinak spojili nástroje třetích stran. Jak modely získávají schopnost jednat na obrazovkách, hranice mezi asistentem umělé inteligence a autonomním operátorem se stále stírá – stejně jako hranice mezi průlomem v produktivitě a bezpečnostním závazkem. Odpovědí společnosti Google na toto napětí jsou vrstvená ochranná opatření a trénink protivníků. Zda to stačí k uspokojení podniků, které se vyhýbají riziku, určí, jak rychle se agenti používající počítače přesunou z ukázek na každodenní použití.

S Gemini 3.5 Flash vsadil Google jasnou sázku: budoucnost umělé inteligence nejsou jen modely, které odpovídají, ale modely, které jednají – a chce, aby vývojáři tyto modely na její platformě postavili.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →