Google DeepMind ने Gemini 3.5 Flash मधील अंगभूत साधनामध्ये संगणकाचा वापर बदलला आहे, ज्यामुळे विकासकांना AI एजंट तयार करण्याचा एक नेटिव्ह मार्ग मिळतो जो तृतीय-पक्ष फ्रेमवर्कवर न बोलता सर्व प्लॅटफॉर्मवर सॉफ्टवेअरशी संवाद साधू शकतो.

24 जून 2026 रोजी Google च्या अधिकृत कीवर्ड ब्लॉगवर प्रकाशित केलेली घोषणा, जेमिनी 3.5 फ्लॅशला एजंट्ससाठी वेगवान बाजारात स्पर्धक म्हणून स्थान दिले आहे जे स्क्रीन पाहू शकतात, कर्सर हलवू शकतात, क्लिक करू शकतात आणि टाइप करू शकतात — क्षमता ज्यांना अलीकडेपर्यंत लक्षणीय कस्टम अभियांत्रिकीची आवश्यकता होती. For more context on this story, see our ongoing AI trends.

"संगणक वापर आता जेमिनी 3.5 फ्लॅश मध्ये एक अंगभूत साधन आहे जे एजंट तयार करण्यासाठी जे प्लॅटफॉर्मवर संवाद साधू शकतात," कंपनीने लिहिले. हे पोस्ट Google DeepMind चे उत्पादन व्यवस्थापक Mateo Quiros यांनी लिहिले आहे.

हे कसे कार्य करते

संगणकाचा वापर एखाद्या मॉडेलला माणसाप्रमाणे संगणक चालवण्याची परवानगी देतो: स्क्रीनवर काय आहे याचा अर्थ लावणे आणि क्लिक करणे, स्क्रोल करणे आणि मजकूर प्रविष्ट करणे यासारख्या क्रिया करून. स्वतंत्र उत्पादन म्हणून ऑफर करण्याऐवजी जेमिनी 3.5 फ्लॅशमध्ये क्षमता थेट बेक करून, Google वास्तविक ऍप्लिकेशन्स, वेबसाइट्स आणि ऑपरेटिंग सिस्टमवर नेव्हिगेट करणारे एजंट तयार करू इच्छिणाऱ्या विकासकांसाठी अडथळा कमी करत आहे.

ब्लॉग पोस्टनुसार, विकासक आणि उपक्रम जेमिनी API आणि जेमिनी एंटरप्राइझ एजंट प्लॅटफॉर्मद्वारे 3.5 फ्लॅशमध्ये संगणकाचा वापर सुरू करू शकतात, एजंट तयार करण्यासाठी आणि मोठ्या प्रमाणावर तैनात करण्यासाठी Google चे समर्पित वातावरण आहे.

Google ने ठोस वापराच्या केसेससह क्षमता प्रदर्शित केली. एका उदाहरणात, Gemini 3.5 Flash ने Gemini ॲपचेच विश्लेषण करण्यासाठी संगणकाचा वापर केला आणि वैशिष्ट्यांची वर्गीकृत सूची परत केली. दुसऱ्यामध्ये, मॉडेलने प्रवेशयोग्यतेच्या समस्यांसाठी स्वतःचे दस्तऐवज ऑडिट केले - एक स्वयं-संदर्भ कार्य जे संगणक-वापरणारे एजंट एक दिवस ते चालवल्या जाणाऱ्या सॉफ्टवेअर इकोसिस्टमची देखभाल कशी करू शकतात हे सूचित करते.

सुरक्षा: विरोधी प्रशिक्षण आणि 'संरक्षण-सखोल' दृष्टीकोन

रिलीझचा सर्वात परिणामकारक भाग Google ने सुरक्षिततेबद्दल जे सांगितले ते असू शकते. थेट वातावरणात काम करणारे एजंट प्रॉम्प्ट इंजेक्शनसाठी अनन्यपणे असुरक्षित असतात - हल्ले ज्यामध्ये वेबपृष्ठ, ईमेल किंवा दस्तऐवजात एम्बेड केलेल्या छुप्या सूचना एजंटला अनपेक्षित कृती करण्यासाठी अपहृत करतात.

Google ने सांगितले की ते जोखीम कमी करण्यासाठी Gemini 3.5 Flash मध्ये संगणक वापरासाठी लक्ष्यित विरोधी प्रशिक्षण वापरले. हे दोन पर्यायी एंटरप्राइझ सेफगार्ड सिस्टम देखील जारी करत आहे जे कंपनीने म्हटले आहे की संस्थांना त्यांचे एजंट काय करू शकतात ते अधिक चांगल्या प्रकारे नियंत्रित करण्यास सक्षम करतात.

"संरक्षण-सखोल" दृष्टीकोन घेऊन, Google ने विकसकांना सुरक्षित सँडबॉक्सिंग, मानवी-इन-द-लूप पडताळणी आणि कठोर प्रवेश नियंत्रणांसह ही वैशिष्ट्ये एकत्रित करण्यासाठी प्रोत्साहित केले. कंपनीने वैशिष्ट्यासाठी त्याच्या सर्वोत्तम सराव दस्तऐवजीकरणामध्ये अतिरिक्त मार्गदर्शन प्रकाशित केले आहे.

ते फ्रेमिंग महत्त्वाचे आहे. कॉम्प्युटरचा वापर हा वापरकर्त्याच्या खात्यांमध्ये आणि प्रणालींमध्ये वापरकर्त्याच्या खाती आणि प्रणालींमध्ये वास्तविक-जागतिक कृती करू शकतो, कारण तडजोड करणारा एजंट वापरण्याची क्षमता म्हणून वापरला जातो. विरोधी प्रशिक्षण आणि स्तरित सुरक्षेचे नेतृत्व करून, Google एंटरप्राइझ खरेदीदारांना आश्वस्त करण्याचा प्रयत्न करत आहे जे कर्सरचे नियंत्रण AI ला देण्यास कचरत आहेत.

संगणकाचा वापर रणांगण का बनत आहे

जेमिनी 3.5 फ्लॅशचा संगणक वापर केवळ प्रश्नांची उत्तरे देण्याऐवजी उपयुक्त कार्य करू शकतील असे एजंट तयार करण्याच्या प्रमुख AI लॅबच्या शर्यतीत आला आहे. अँथ्रोपिकने 2024 च्या उत्तरार्धात क्लॉडसाठी संगणक वापरण्याचे साधन सादर केले आणि ओपनएआयचे ऑपरेटर आणि एजंट उत्पादने त्याच दिशेने पुढे गेले आहेत. फ्लॅश सारख्या जलद, किफायतशीर मॉडेलची क्षमता मूळ बनवणे — प्रीमियम टियरसाठी राखून ठेवण्याऐवजी — हे संकेत देते की Google एजंट नियंत्रणाला त्वरीत कमोडिटाइज करू इच्छित आहे.

फ्लॅशची निवड स्वतःच लक्षणीय आहे. फ्लॅश हे Google चे कार्यक्षमता-स्तरीय मॉडेल आहे, जे वेग आणि खर्चासाठी अनुकूल आहे. केवळ मोठ्या प्रो मॉडेलमध्ये वापरण्याऐवजी तेथे संगणकाचा वापर एम्बेड करणे सुचविते की Google उच्च-व्हॉल्यूम, विलंब-संवेदनशील एजंट वर्कलोड्सची अपेक्षा करतो — अशा प्रकारचा जो व्यवसाय सॉफ्टवेअरमध्ये मोठ्या प्रमाणावर पुनरावृत्ती होणारी कार्ये स्वयंचलित करतो.

Google ने सांगितले की ते आधीपासूनच ग्राहकांना संगणकाच्या वापरासह मूल्य वाढवताना दिसत आहे, जरी ब्लॉग पोस्टने विशिष्ट व्यावसायिक उपयोजनांना नाव दिले नाही किंवा परिणामांचे प्रमाण दिले नाही.

स्पर्धात्मक खेळ

विकसकांसाठी, अंगभूत संगणक-वापर साधनाचे आवाहन सरळ आहे: देखरेखीसाठी कमी एकत्रीकरण आणि मॉडेल आणि एजंटिक स्तर दोन्हीसाठी जबाबदार एक विक्रेता. परंतु हे Google च्या प्लॅटफॉर्मवर अवलंबित्व देखील वाढवते, एक ट्रेडऑफ जे एंटरप्राइजेस मॉडेल-अज्ञेयवादी एजंट फ्रेमवर्कच्या लवचिकतेच्या विरूद्ध वजन करतील.

प्रकाशन देखील एजंट अर्थव्यवस्थेत एक व्यापक ताण धारदार. स्वतंत्रपणे विकसित केलेले ओपन-सोर्स एजंट गेटवे, जसे की लाइटपोर्ट फ्रेमवर्क जे एकाधिक LLM प्रदाते OpenAI-सुसंगत बनवते, पोर्टेबल एजंट पायाभूत सुविधांसाठी किती मागणी अस्तित्वात आहे हे दर्शविते. Google ची पैज अशी आहे की प्रथम-पक्ष, सुरक्षितता-कठोर संगणक-वापर साधन विकासकांवर विजय मिळवेल जे अन्यथा तृतीय-पक्ष साधने एकत्र जोडतील. मॉडेल्स स्क्रीनवर कार्य करण्याची क्षमता प्राप्त करत असताना, AI सहाय्यक आणि स्वायत्त ऑपरेटर यांच्यातील रेषा अस्पष्ट होत राहते — आणि त्याचप्रमाणे उत्पादकता प्रगती आणि सुरक्षा दायित्व यांच्यातील रेषा देखील अस्पष्ट होते. त्या तणावाला Google चे उत्तर म्हणजे स्तरित सुरक्षा आणि विरोधी प्रशिक्षण. जोखीम-प्रतिरोधक उपक्रमांना पूर्ण करण्यासाठी ते पुरेसे आहे की नाही हे संगणक-वापरणारे एजंट डेमोमधून दैनंदिन वापराकडे किती लवकर जातात हे ठरवेल.

Gemini 3.5 Flash सह, Google ने एक स्पष्ट पैज लावली आहे: AI चे भविष्य फक्त उत्तर देणारे मॉडेल नाही तर ते मॉडेल आहेत जे कार्य करतात — आणि विकासकांना ते अभिनय मॉडेल्स त्याच्या प्लॅटफॉर्मवर तयार करायचे आहेत.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →