Google DeepMind a transformat utilizarea computerului într-un instrument încorporat în Gemini 3.5 Flash, oferind dezvoltatorilor o modalitate nativă de a construi agenți AI care pot interacționa cu software-ul pe platforme fără să se folosească de cadre terțe.
Anunțul, publicat pe 24 iunie 2026 pe blogul oficial Google Keyword, poziționează Gemini 3.5 Flash ca un competitor pe piața în mișcare rapidă pentru agenții care pot vedea un ecran, pot muta un cursor, face clic și tastează - capabilități care până de curând necesitau o inginerie personalizată semnificativă. For more context on this story, see our ongoing latest AI developments.
„Utilizarea computerului este acum un instrument încorporat în Gemini 3.5 Flash pentru a construi agenți care pot interacționa între platforme”, a scris compania. Postarea a fost scrisă de Mateo Quiros, un manager de produs la Google DeepMind.
Cum funcționează
Utilizarea computerului permite unui model să opereze un computer la fel ca un om: interpretând ceea ce este pe ecran și luând acțiuni precum clic, derulare și introducere de text. Prin integrarea capacității direct în Gemini 3.5 Flash, în loc să o ofere ca produs separat, Google reduce bariera pentru dezvoltatorii care doresc să creeze agenți care navighează în aplicații, site-uri web și sisteme de operare reale.
Potrivit postării pe blog, dezvoltatorii și întreprinderile pot începe să utilizeze computerul în 3.5 Flash prin intermediul Gemini API și Gemini Enterprise Agent Platform, mediul dedicat Google pentru construirea și implementarea agenților la scară.
Google a demonstrat capacitatea cu cazuri de utilizare concrete. Într-un exemplu, Gemini 3.5 Flash a folosit computerul pentru a analiza aplicația Gemini în sine și pentru a returna o listă clasificată de caracteristici. În altul, modelul și-a auditat propria documentație pentru probleme de accesibilitate - o sarcină autoreferențială care sugerează modul în care agenții care folosesc computerul ar putea ajuta într-o zi la menținerea ecosistemelor software pe care rulează.
Siguranță: antrenament adversar și o abordare „de apărare în profunzime”.
Partea cea mai importantă a lansării poate fi ceea ce a spus Google despre siguranță. Agenții care operează în medii live sunt în mod unic vulnerabili la injectarea promptă - atacuri în care instrucțiunile ascunse încorporate într-o pagină web, e-mail sau document deturnează agentul pentru a face acțiuni neintenționate.
Google a spus că a folosit antrenamentul adversar vizat pentru utilizarea computerului în Gemini 3.5 Flash pentru a atenua aceste riscuri. De asemenea, lansează două sisteme opționale de protecție a întreprinderilor despre care compania a spus că le permit organizațiilor să controleze mai bine ceea ce pot face agenții lor.
Luând o abordare „de apărare în profunzime”, Google a încurajat dezvoltatorii să combine aceste funcții cu sandbox securizat, verificare umană în buclă și controale stricte de acces. Compania a publicat îndrumări suplimentare în documentația cu cele mai bune practici pentru această funcție.
Acea încadrare contează. Utilizarea computerului este văzută pe scară largă ca una dintre capabilitățile agentului mai periculoase de implementat, deoarece un agent compromis poate întreprinde acțiuni în lumea reală în conturile și sistemele unui utilizator. Prin antrenament advers și garanții stratificate, Google încearcă să liniștească cumpărătorii întreprinderilor care au ezitat să controleze un cursor către o IA.
De ce utilizarea computerului devine un câmp de luptă
Utilizarea computerului Gemini 3.5 Flash vine în timp ce principalele laboratoare de inteligență artificială se întrec pentru a crea agenți care pot face o muncă utilă, mai degrabă decât să răspundă la întrebări. Anthropic a introdus un instrument de utilizare a computerului pentru Claude la sfârșitul anului 2024, iar produsele pentru operator și agenți OpenAI au împins în aceeași direcție. Efectuarea capacității native pentru un model rapid și eficient din punct de vedere al costurilor, cum ar fi Flash, mai degrabă decât rezervarea acesteia pentru un nivel premium, semnalează că Google dorește să comercializeze rapid controlul agenților.
Alegerea Flash este ea însăși notabilă. Flash este modelul Google la nivel de eficiență, optimizat pentru viteză și cost. Încorporarea utilizării computerului acolo, mai degrabă decât doar în modelul Pro mai mare, sugerează că Google se așteaptă la volum mare de volum de lucru, sensibil la latență, de tipul care automatizează sarcinile repetitive în software-ul de afaceri la scară.
Google a spus că deja vede clienții generează valoare prin utilizarea computerelor, deși articolul de blog nu a menționat implementări comerciale specifice și nu a cuantificat rezultatele.
Mizele competitive
Pentru dezvoltatori, atractia unui instrument de utilizare a computerului încorporat este simplă: mai puține integrări de menținut și un singur furnizor responsabil atât pentru model, cât și pentru stratul agentic. Dar, de asemenea, adâncește dependența de platforma Google, un compromis pe care întreprinderile îl vor cântări în raport cu flexibilitatea cadrelor de agenți agnostice de model.
De asemenea, eliberarea accentuează o tensiune mai largă în economia agentului. Gateway-urile de agenți open-source dezvoltate independent, cum ar fi cadrul Lightport, care face ca mai mulți furnizori LLM să fie compatibili cu OpenAI, arată cât de multă cerere există pentru infrastructura de agenți portabili. Pariul Google este că un instrument de utilizare a computerului de la prima parte, întărit din punct de vedere al siguranței, va câștiga dezvoltatorii care altfel ar combina instrumente terțe. Pe măsură ce modelele dobândesc capacitatea de a acționa pe ecrane, demarcația dintre un asistent AI și un operator autonom continuă să se estompeze - la fel și demarcația dintre un progres în productivitate și o răspundere de securitate. Răspunsul Google la această tensiune este garanțiile stratificate și antrenamentul advers. Dacă acest lucru este suficient pentru a satisface întreprinderile care au aversión la riscuri, va determina cât de repede trec agenții care folosesc computerul de la demonstrații la utilizarea zilnică.
Cu Gemini 3.5 Flash, Google a făcut un pariu clar: viitorul AI nu este doar modele care răspund, ci modele care acționează - și dorește ca dezvoltatorii să construiască acele modele de acțiune pe platforma sa.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →


