Google DeepMind har förvandlat datoranvändning till ett inbyggt verktyg i Gemini 3.5 Flash, vilket ger utvecklare ett inbyggt sätt att bygga AI-agenter som kan interagera med programvara på olika plattformar utan att sätta fast ramverk från tredje part.

Tillkännagivandet, som publicerades den 24 juni 2026 på Googles officiella sökordsblogg, positionerar Gemini 3.5 Flash som en utmanare på den snabbrörliga marknaden för agenter som kan se en skärm, flytta en markör, klicka och skriva - funktioner som tills nyligen krävde betydande anpassad konstruktion. For more context on this story, see our ongoing latest AI developments.

"Datoranvändning är nu ett inbyggt verktyg i Gemini 3.5 Flash för att bygga agenter som kan interagera över plattformar", skrev företaget. Inlägget skrevs av Mateo Quiros, produktchef på Google DeepMind.

Hur det fungerar

Datoranvändning gör att en modell kan använda en dator ungefär som en människa skulle göra: genom att tolka vad som visas på skärmen och vidta åtgärder som att klicka, rulla och skriva in text. Genom att bygga in kapaciteten direkt i Gemini 3.5 Flash istället för att erbjuda den som en separat produkt, sänker Google barriären för utvecklare som vill bygga agenter som navigerar i riktiga applikationer, webbplatser och operativsystem.

Enligt blogginlägget kan utvecklare och företag börja använda datoranvändning i 3.5 Flash via Gemini API och Gemini Enterprise Agent Platform, Googles dedikerade miljö för att bygga och distribuera agenter i stor skala.

Google visade förmågan med konkreta användningsfall. I ett exempel använde Gemini 3.5 Flash datoranvändning för att analysera själva Gemini-appen och returnera en kategoriserad lista med funktioner. I en annan granskade modellen sin egen dokumentation för tillgänglighetsproblem – en självrefererande uppgift som tipsar om hur datoranvändande agenter en dag kan hjälpa till att underhålla mjukvaruekosystemen de kör på.

Säkerhet: Motstridande utbildning och ett "djupgående försvar".

Den mest följdriktiga delen av releasen kan vara vad Google sa om säkerhet. Agenter som arbetar i levande miljöer är unikt sårbara för snabba injektion – attacker där dolda instruktioner inbäddade på en webbsida, e-post eller dokument kapar agenten till att vidta oavsiktliga åtgärder.

Google sa att de använde riktad motståndsutbildning för datoranvändning i Gemini 3.5 Flash för att minska dessa risker. Det släpper också två valfria företagsskyddssystem som företaget sa gör det möjligt för organisationer att bättre kontrollera vad deras agenter kan göra.

Med ett "försvar-i-djupet" tillvägagångssätt uppmuntrade Google utvecklare att kombinera dessa funktioner med säker sandlådor, verifiering av människor i slingan och strikta åtkomstkontroller. Företaget publicerade ytterligare vägledning i sin dokumentation om bästa praxis för funktionen.

Den inramningen spelar roll. Datoranvändning ses allmänt som en av de farligare agentfunktionerna att distribuera, eftersom en komprometterad agent kan vidta verkliga åtgärder i en användares konton och system. Genom att leda med kontradiktorisk utbildning och skiktade skyddsåtgärder försöker Google lugna företagsköpare som har varit tveksamma till att överlåta kontrollen av en markör till en AI.

Varför datoranvändning blir ett slagfält

Gemini 3.5 Flashs datoranvändning kommer när de stora AI-labben tävlar om att skapa agenter som kan göra användbart arbete snarare än att bara svara på frågor. Anthropic introducerade ett datoranvändningsverktyg för Claude i slutet av 2024, och OpenAI:s operatörs- och agentprodukter har drivit i samma riktning. Att göra kapaciteten inbyggd i en snabb, kostnadseffektiv modell som Flash – snarare än att reservera den för en premiumnivå – signalerar att Google snabbt vill commoditize agentkontrollen.

Valet av Flash är i sig anmärkningsvärt. Flash är Googles effektivitetsmodell, optimerad för hastighet och kostnad. Att bädda in datoranvändning där, snarare än bara i den större Pro-modellen, antyder att Google förväntar sig höga volymer, latenskänsliga agentarbetsbelastningar – den typen som automatiserar repetitiva uppgifter i affärsprogramvara i stor skala.

Google sa att de redan ser kunderna öka värde med datoranvändning, även om blogginlägget inte namngav specifika kommersiella implementeringar eller kvantifierade resultaten.

De konkurrenskraftiga insatserna

För utvecklare är överklagandet av ett inbyggt datoranvändningsverktyg okomplicerat: färre integrationer att underhålla och en enda leverantör som ansvarar för både modellen och agentskiktet. Men det fördjupar också beroendet av Googles plattform, en avvägning som företag kommer att väga mot flexibiliteten hos modellagnostiska agentramar.

Releasen skärper också en bredare spänning i agentekonomin. Oberoende utvecklade agentgateways med öppen källkod, som Lightport-ramverket som gör flera LLM-leverantörer OpenAI-kompatibla, visar hur stor efterfrågan det finns på portabel agentinfrastruktur. Googles insats är att ett förstaparts, säkerhetshärdat datoranvändningsverktyg kommer att vinna över utvecklare som annars skulle sy ihop verktyg från tredje part. När modeller får förmågan att agera på skärmar, blir gränsen mellan en AI-assistent och en autonom operatör suddig – och det gör också gränsen mellan ett produktivitetsgenombrott och ett säkerhetsansvar. Googles svar på den spänningen är skiktade skyddsåtgärder och motståndskraftig träning. Huruvida det är tillräckligt för att tillfredsställa riskvilliga företag kommer att avgöra hur snabbt datoranvändande agenter går från demos till daglig användning.

Med Gemini 3.5 Flash har Google gjort en tydlig satsning: framtiden för AI är inte bara modeller som svarar, utan modeller som agerar - och det vill att utvecklare bygger dessa skådespelarmodeller på sin plattform.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →