Google डीपमाइंड ने कंप्यूटर के उपयोग को जेमिनी 3.5 फ्लैश के अंदर एक अंतर्निहित टूल में बदल दिया है, जिससे डेवलपर्स को एआई एजेंट बनाने का एक मूल तरीका मिल गया है जो तीसरे पक्ष के ढांचे पर बोल्ट लगाए बिना सभी प्लेटफार्मों पर सॉफ्टवेयर के साथ बातचीत कर सकता है।

Google के आधिकारिक कीवर्ड ब्लॉग पर 24 जून, 2026 को प्रकाशित घोषणा, जेमिनी 3.5 फ्लैश को उन एजेंटों के लिए तेजी से आगे बढ़ने वाले बाजार में एक दावेदार के रूप में पेश करती है जो स्क्रीन देख सकते हैं, कर्सर ले जा सकते हैं, क्लिक कर सकते हैं और टाइप कर सकते हैं - ऐसी क्षमताएं जिनके लिए हाल ही में महत्वपूर्ण कस्टम इंजीनियरिंग की आवश्यकता होती है। For more context on this story, see our ongoing latest AI developments.

कंपनी ने लिखा, "एजेंट बनाने के लिए जेमिनी 3.5 फ्लैश में कंप्यूटर का उपयोग अब एक अंतर्निहित टूल है जो सभी प्लेटफार्मों पर बातचीत कर सकता है।" यह पोस्ट Google DeepMind के उत्पाद प्रबंधक माटेओ क्विरोस द्वारा लिखी गई थी।

यह कैसे काम करता है

कंप्यूटर का उपयोग एक मॉडल को एक इंसान की तरह कंप्यूटर को संचालित करने की अनुमति देता है: स्क्रीन पर क्या है उसकी व्याख्या करके और क्लिक करने, स्क्रॉल करने और टेक्स्ट दर्ज करने जैसी क्रियाएं करके। क्षमता को एक अलग उत्पाद के रूप में पेश करने के बजाय सीधे जेमिनी 3.5 फ्लैश में डालकर, Google उन डेवलपर्स के लिए बाधा कम कर रहा है जो ऐसे एजेंट बनाना चाहते हैं जो वास्तविक एप्लिकेशन, वेबसाइट और ऑपरेटिंग सिस्टम को नेविगेट करते हैं।

ब्लॉग पोस्ट के अनुसार, डेवलपर्स और उद्यम जेमिनी एपीआई और जेमिनी एंटरप्राइज एजेंट प्लेटफॉर्म के माध्यम से 3.5 फ्लैश में कंप्यूटर का उपयोग शुरू कर सकते हैं, जो बड़े पैमाने पर एजेंटों के निर्माण और तैनाती के लिए Google का समर्पित वातावरण है।

Google ने ठोस उपयोग के मामलों के साथ क्षमता का प्रदर्शन किया। एक उदाहरण में, जेमिनी 3.5 फ्लैश ने जेमिनी ऐप का विश्लेषण करने और सुविधाओं की एक वर्गीकृत सूची वापस करने के लिए कंप्यूटर का उपयोग किया। दूसरे में, मॉडल ने एक्सेसिबिलिटी मुद्दों के लिए अपने स्वयं के दस्तावेज़ीकरण का ऑडिट किया - एक स्व-संदर्भित कार्य जो संकेत देता है कि कंप्यूटर का उपयोग करने वाले एजेंट एक दिन अपने द्वारा चलाए जाने वाले सॉफ़्टवेयर पारिस्थितिकी तंत्र को बनाए रखने में कैसे मदद कर सकते हैं।

सुरक्षा: प्रतिकूल प्रशिक्षण और 'गहराई से रक्षा' दृष्टिकोण

रिलीज़ का सबसे महत्वपूर्ण भाग वह हो सकता है जो Google ने सुरक्षा के बारे में कहा है। लाइव वातावरण में काम करने वाले एजेंट विशिष्ट रूप से शीघ्र इंजेक्शन के प्रति संवेदनशील होते हैं - ऐसे हमले जिनमें वेबपेज, ईमेल या दस्तावेज़ में एम्बेडेड छिपे हुए निर्देश एजेंट को अनपेक्षित कार्रवाई करने के लिए हाईजैक कर लेते हैं।

Google ने कहा कि उसने उन जोखिमों को कम करने के लिए जेमिनी 3.5 फ्लैश में कंप्यूटर के उपयोग के लिए लक्षित प्रतिकूल प्रशिक्षण का उपयोग किया। कंपनी ने कहा कि यह दो वैकल्पिक उद्यम सुरक्षा प्रणालियाँ भी जारी कर रही है जो संगठनों को उनके एजेंट क्या कर सकते हैं, इसे बेहतर ढंग से नियंत्रित करने में सक्षम बनाती हैं।

"रक्षा-में-गहराई" दृष्टिकोण अपनाते हुए, Google ने डेवलपर्स को इन सुविधाओं को सुरक्षित सैंडबॉक्सिंग, मानव-इन-द-लूप सत्यापन और सख्त पहुंच नियंत्रण के साथ संयोजित करने के लिए प्रोत्साहित किया। कंपनी ने इस सुविधा के लिए अपने सर्वोत्तम अभ्यास दस्तावेज़ में अतिरिक्त मार्गदर्शन प्रकाशित किया।

वह फ़्रेमिंग मायने रखती है. कंप्यूटर के उपयोग को व्यापक रूप से तैनात करने के लिए अधिक खतरनाक एजेंट क्षमताओं में से एक के रूप में देखा जाता है, क्योंकि एक समझौता एजेंट उपयोगकर्ता के खातों और सिस्टम के अंदर वास्तविक दुनिया की कार्रवाई कर सकता है। प्रतिकूल प्रशिक्षण और स्तरित सुरक्षा उपायों के साथ आगे बढ़कर, Google उन उद्यम खरीदारों को आश्वस्त करने का प्रयास कर रहा है जो कर्सर का नियंत्रण AI को सौंपने में झिझक रहे हैं।

कंप्यूटर का उपयोग युद्ध का मैदान क्यों बनता जा रहा है

जेमिनी 3.5 फ्लैश का कंप्यूटर उपयोग ऐसे समय में हो रहा है जब प्रमुख एआई प्रयोगशालाएं ऐसे एजेंट बनाने की होड़ में हैं जो सिर्फ सवालों के जवाब देने के बजाय उपयोगी काम कर सकें। एंथ्रोपिक ने 2024 के अंत में क्लाउड के लिए एक कंप्यूटर उपयोग उपकरण पेश किया, और ओपनएआई के ऑपरेटर और एजेंट उत्पादों ने उसी दिशा में काम किया है। क्षमता को फ्लैश जैसे तेज़, लागत-कुशल मॉडल के लिए मूल बनाना - इसे प्रीमियम स्तर के लिए आरक्षित करने के बजाय - संकेत देता है कि Google एजेंट नियंत्रण को जल्दी से कमोडिटीज़ करना चाहता है।

फ़्लैश का चयन अपने आप में उल्लेखनीय है. फ़्लैश Google का दक्षता-स्तरीय मॉडल है, जो गति और लागत के लिए अनुकूलित है। केवल बड़े प्रो मॉडल के बजाय वहां कंप्यूटर का उपयोग एम्बेड करने से पता चलता है कि Google को उच्च-मात्रा, विलंबता-संवेदनशील एजेंट वर्कलोड की उम्मीद है - जिस तरह से बड़े पैमाने पर व्यावसायिक सॉफ़्टवेयर में दोहराए जाने वाले कार्यों को स्वचालित किया जाता है।

Google ने कहा कि वह पहले से ही देख रहा है कि ग्राहक कंप्यूटर के उपयोग से मूल्य बढ़ा रहे हैं, हालांकि ब्लॉग पोस्ट में विशिष्ट वाणिज्यिक तैनाती का नाम नहीं दिया गया या परिणामों की मात्रा निर्धारित नहीं की गई।

प्रतिस्पर्धी दांव

डेवलपर्स के लिए, एक अंतर्निहित कंप्यूटर-उपयोग टूल की अपील सीधी है: बनाए रखने के लिए कम एकीकरण और मॉडल और एजेंटिक परत दोनों के लिए एक ही विक्रेता जवाबदेह है। लेकिन यह Google के प्लेटफ़ॉर्म पर निर्भरता को भी गहरा करता है, एक ऐसा समझौता जिसे उद्यम मॉडल-अज्ञेयवादी एजेंट ढाँचे के लचीलेपन के विरुद्ध तौलेंगे।

इस रिहाई से एजेंट अर्थव्यवस्था में व्यापक तनाव भी बढ़ गया है। स्वतंत्र रूप से विकसित ओपन-सोर्स एजेंट गेटवे, जैसे कि लाइटपोर्ट फ्रेमवर्क जो कई एलएलएम प्रदाताओं को ओपनएआई-संगत बनाता है, दिखाता है कि पोर्टेबल एजेंट बुनियादी ढांचे की कितनी मांग मौजूद है। Google का दावा है कि प्रथम-पक्ष, सुरक्षा-कठोर कंप्यूटर-उपयोग उपकरण उन डेवलपर्स पर जीत हासिल करेगा जो अन्यथा तृतीय-पक्ष टूल को एक साथ जोड़ देंगे। जैसे-जैसे मॉडल स्क्रीन पर कार्य करने की क्षमता हासिल करते हैं, एआई सहायक और एक स्वायत्त ऑपरेटर के बीच की रेखा धुंधली होती जाती है - और इसी तरह उत्पादकता में सफलता और सुरक्षा दायित्व के बीच की रेखा भी धुंधली होती जाती है। उस तनाव पर Google का उत्तर स्तरित सुरक्षा उपाय और प्रतिकूल प्रशिक्षण है। क्या यह जोखिम से बचने वाले उद्यमों को संतुष्ट करने के लिए पर्याप्त है, यह निर्धारित करेगा कि कंप्यूटर का उपयोग करने वाले एजेंट डेमो से दैनिक उपयोग की ओर कितनी तेजी से आगे बढ़ते हैं।

जेमिनी 3.5 फ्लैश के साथ, Google ने एक स्पष्ट शर्त लगाई है: AI का भविष्य केवल जवाब देने वाले मॉडल नहीं है, बल्कि कार्य करने वाले मॉडल हैं - और यह चाहता है कि डेवलपर्स अपने प्लेटफ़ॉर्म पर उन अभिनय मॉडल का निर्माण करें।

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →