Google DeepMind استفاده از رایانه را به یک ابزار داخلی در Gemini 3.5 Flash تبدیل کرده است و به توسعه دهندگان راهی برای ساخت عوامل هوش مصنوعی می دهد که می توانند با نرم افزار در سراسر پلتفرم ها بدون اتصال به چارچوب های شخص ثالث تعامل داشته باشند.
این اعلامیه که در 24 ژوئن 2026 در وبلاگ رسمی کلمه کلیدی گوگل منتشر شد، Gemini 3.5 Flash را به عنوان یک رقیب در بازار پرشتاب برای عواملی که می توانند صفحه را ببینند، مکان نما را حرکت دهند، کلیک کنند و تایپ کنند، قرار می دهد - قابلیت هایی که تا همین اواخر به مهندسی سفارشی قابل توجهی نیاز داشت. For more context on this story, see our ongoing AI industry coverage.
این شرکت نوشت: «استفاده از رایانه اکنون یک ابزار داخلی در فلش Gemini 3.5 برای ساخت عواملی است که می توانند در بین پلتفرم ها تعامل داشته باشند. این پست توسط Mateo Quiros، مدیر محصول در Google DeepMind نوشته شده است.
چگونه کار می کند
استفاده از رایانه به یک مدل اجازه می دهد تا مانند یک انسان با رایانه کار کند: با تفسیر آنچه روی صفحه است و انجام اقداماتی مانند کلیک کردن، پیمایش و وارد کردن متن. گوگل با قرار دادن این قابلیت مستقیماً در Gemini 3.5 Flash به جای ارائه آن به عنوان یک محصول جداگانه، مانع توسعه دهندگانی را که می خواهند عواملی را بسازند که برنامه ها، وب سایت ها و سیستم عامل های واقعی را هدایت می کنند، کاهش دهد.
طبق این پست وبلاگ، توسعه دهندگان و شرکت ها می توانند از طریق Gemini API و Gemini Enterprise Agent Platform، محیط اختصاصی Google برای ساخت و استقرار عوامل در مقیاس، استفاده از رایانه را در Flash 3.5 شروع کنند.
گوگل این قابلیت را با موارد استفاده مشخص نشان داد. در یک مثال، Gemini 3.5 Flash از رایانه برای تجزیه و تحلیل خود برنامه Gemini و بازگرداندن لیست طبقه بندی شده از ویژگی ها استفاده کرد. در مدلی دیگر، این مدل مستندات خود را برای مسائل دسترسپذیری ممیزی کرد - یک کار خودارجاعی که نشان میدهد چگونه عوامل استفادهکننده از رایانه ممکن است روزی به حفظ اکوسیستم نرمافزاری که روی آن اجرا میشوند کمک کنند.
ایمنی: آموزش خصمانه و رویکرد "دفاع در عمق"
مهم ترین بخش انتشار ممکن است آنچه گوگل در مورد ایمنی گفته است باشد. عواملی که در محیطهای زنده کار میکنند به طور منحصربهفردی در برابر تزریق سریع آسیبپذیر هستند - حملاتی که در آن دستورالعملهای پنهان تعبیهشده در یک صفحه وب، ایمیل یا سند، عامل را برای انجام اقدامات ناخواسته ربودهاند.
گوگل گفت که از آموزش هدفمند دشمن برای استفاده از رایانه در Gemini 3.5 Flash برای کاهش این خطرات استفاده کرده است. این شرکت همچنین در حال انتشار دو سیستم حفاظتی اختیاری سازمانی است که به گفته این شرکت، سازمانها را قادر میسازد تا کارهایی را که نمایندگانشان میتوانند انجام دهند را بهتر کنترل کنند.
گوگل با اتخاذ رویکرد "دفاع در عمق"، توسعه دهندگان را تشویق کرد تا این ویژگی ها را با جعبه ایمنی ایمن، تایید انسان در حلقه و کنترل های دسترسی دقیق ترکیب کنند. این شرکت راهنمایی های اضافی را در مستندات بهترین شیوه های خود برای این ویژگی منتشر کرد.
این قاب بندی مهم است. استفاده از رایانه به طور گسترده به عنوان یکی از خطرناکترین قابلیتهای عامل برای استقرار در نظر گرفته میشود، زیرا یک عامل در معرض خطر میتواند اقداماتی را در دنیای واقعی در داخل حسابها و سیستمهای کاربر انجام دهد. گوگل با پیشروی با آموزش های خصمانه و پادمان های لایه ای، سعی دارد به خریداران سازمانی که در واگذاری کنترل مکان نما به هوش مصنوعی مردد بوده اند، اطمینان دهد.
چرا استفاده از کامپیوتر به میدان جنگ تبدیل شده است
استفاده از رایانه Gemini 3.5 Flash زمانی که آزمایشگاههای اصلی هوش مصنوعی به رقابت میپردازند تا عواملی را بسازند که به جای پاسخ دادن به سؤالات، کار مفیدی انجام دهند، وارد میشود. Anthropic در اواخر سال 2024 ابزار استفاده از رایانه را برای Claude معرفی کرد و اپراتور و محصولات عامل OpenAI در همین مسیر حرکت کردند. بومی ساختن این قابلیت برای یک مدل سریع و مقرون به صرفه مانند Flash - به جای رزرو آن برای یک سطح برتر - نشان می دهد که Google می خواهد کنترل عامل را به سرعت کالایی کند.
انتخاب فلش به خودی خود قابل توجه است. Flash مدل سطح کارایی گوگل است که برای سرعت و هزینه بهینه شده است. تعبیه استفاده از رایانه در آنجا، نه فقط در مدل بزرگتر Pro، نشان میدهد که Google انتظار بارهای کاری با حجم بالا و حساس به تأخیر را دارد - نوعی که وظایف تکراری را در نرمافزارهای تجاری در مقیاس خودکار میکند.
گوگل اعلام کرد که در حال حاضر شاهد افزایش ارزش مشتریان با استفاده از رایانه است، اگرچه در این پست وبلاگ به استقرار تجاری خاصی اشاره نشده است یا نتایج را کمی بیان نمی کند.
سهام رقابتی
برای توسعه دهندگان، جذابیت یک ابزار داخلی برای استفاده از رایانه ساده است: ادغام های کمتری برای نگهداری و یک فروشنده واحد مسئول هم برای مدل و هم برای لایه عامل. اما وابستگی به پلتفرم گوگل را نیز عمیقتر میکند، معاملهای که شرکتها در برابر انعطافپذیری چارچوبهای عامل مدل-آگنوستیک میسنجید.
انتشار همچنین تنش گسترده تری را در اقتصاد عامل تشدید می کند. دروازههای عامل منبع باز توسعه یافته مستقل، مانند چارچوب Lightport که چندین ارائهدهنده LLM را با OpenAI سازگار میکند، نشان میدهد که چقدر تقاضا برای زیرساخت عامل قابل حمل وجود دارد. شرط گوگل این است که یک ابزار استفاده از کامپیوتر شخص اول و سخت افزاری ایمنی، بر توسعه دهندگانی که در غیر این صورت ابزارهای شخص ثالث را به هم متصل می کنند، پیروز خواهد شد. همانطور که مدلها توانایی عمل بر روی صفحهنمایش را به دست میآورند، خط بین دستیار هوش مصنوعی و اپراتور مستقل همچنان محو میشود - و همچنین مرز بین پیشرفت بهرهوری و مسئولیت امنیتی محو میشود. پاسخ گوگل به این تنش، حفاظت لایه ای و آموزش خصمانه است. اینکه آیا این برای رضایت شرکتهای ریسکگریز کافی است یا خیر، تعیین میکند که عوامل استفادهکننده از رایانه با چه سرعتی از دمو به استفاده روزانه میروند.
گوگل با Gemini 3.5 Flash شرط بندی واضحی کرده است: آینده هوش مصنوعی فقط مدل هایی نیست که جواب می دهند، بلکه مدل هایی هستند که عمل می کنند – و از توسعه دهندگان می خواهد که این مدل های بازیگری را روی پلتفرم خود بسازند.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →


