Google DeepMind استفاده از رایانه را به یک ابزار داخلی در Gemini 3.5 Flash تبدیل کرده است و به توسعه دهندگان راهی برای ساخت عوامل هوش مصنوعی می دهد که می توانند با نرم افزار در سراسر پلتفرم ها بدون اتصال به چارچوب های شخص ثالث تعامل داشته باشند.

این اعلامیه که در 24 ژوئن 2026 در وبلاگ رسمی کلمه کلیدی گوگل منتشر شد، Gemini 3.5 Flash را به عنوان یک رقیب در بازار پرشتاب برای عواملی که می توانند صفحه را ببینند، مکان نما را حرکت دهند، کلیک کنند و تایپ کنند، قرار می دهد - قابلیت هایی که تا همین اواخر به مهندسی سفارشی قابل توجهی نیاز داشت. For more context on this story, see our ongoing AI industry coverage.

این شرکت نوشت: «استفاده از رایانه اکنون یک ابزار داخلی در فلش Gemini 3.5 برای ساخت عواملی است که می توانند در بین پلتفرم ها تعامل داشته باشند. این پست توسط Mateo Quiros، مدیر محصول در Google DeepMind نوشته شده است.

چگونه کار می کند

استفاده از رایانه به یک مدل اجازه می دهد تا مانند یک انسان با رایانه کار کند: با تفسیر آنچه روی صفحه است و انجام اقداماتی مانند کلیک کردن، پیمایش و وارد کردن متن. گوگل با قرار دادن این قابلیت مستقیماً در Gemini 3.5 Flash به جای ارائه آن به عنوان یک محصول جداگانه، مانع توسعه دهندگانی را که می خواهند عواملی را بسازند که برنامه ها، وب سایت ها و سیستم عامل های واقعی را هدایت می کنند، کاهش دهد.

طبق این پست وبلاگ، توسعه دهندگان و شرکت ها می توانند از طریق Gemini API و Gemini Enterprise Agent Platform، محیط اختصاصی Google برای ساخت و استقرار عوامل در مقیاس، استفاده از رایانه را در Flash 3.5 شروع کنند.

گوگل این قابلیت را با موارد استفاده مشخص نشان داد. در یک مثال، Gemini 3.5 Flash از رایانه برای تجزیه و تحلیل خود برنامه Gemini و بازگرداندن لیست طبقه بندی شده از ویژگی ها استفاده کرد. در مدلی دیگر، این مدل مستندات خود را برای مسائل دسترس‌پذیری ممیزی کرد - یک کار خودارجاعی که نشان می‌دهد چگونه عوامل استفاده‌کننده از رایانه ممکن است روزی به حفظ اکوسیستم نرم‌افزاری که روی آن اجرا می‌شوند کمک کنند.

ایمنی: آموزش خصمانه و رویکرد "دفاع در عمق"

مهم ترین بخش انتشار ممکن است آنچه گوگل در مورد ایمنی گفته است باشد. عواملی که در محیط‌های زنده کار می‌کنند به طور منحصربه‌فردی در برابر تزریق سریع آسیب‌پذیر هستند - حملاتی که در آن دستورالعمل‌های پنهان تعبیه‌شده در یک صفحه وب، ایمیل یا سند، عامل را برای انجام اقدامات ناخواسته ربوده‌اند.

گوگل گفت که از آموزش هدفمند دشمن برای استفاده از رایانه در Gemini 3.5 Flash برای کاهش این خطرات استفاده کرده است. این شرکت همچنین در حال انتشار دو سیستم حفاظتی اختیاری سازمانی است که به گفته این شرکت، سازمان‌ها را قادر می‌سازد تا کارهایی را که نمایندگانشان می‌توانند انجام دهند را بهتر کنترل کنند.

گوگل با اتخاذ رویکرد "دفاع در عمق"، توسعه دهندگان را تشویق کرد تا این ویژگی ها را با جعبه ایمنی ایمن، تایید انسان در حلقه و کنترل های دسترسی دقیق ترکیب کنند. این شرکت راهنمایی های اضافی را در مستندات بهترین شیوه های خود برای این ویژگی منتشر کرد.

این قاب بندی مهم است. استفاده از رایانه به طور گسترده به عنوان یکی از خطرناک‌ترین قابلیت‌های عامل برای استقرار در نظر گرفته می‌شود، زیرا یک عامل در معرض خطر می‌تواند اقداماتی را در دنیای واقعی در داخل حساب‌ها و سیستم‌های کاربر انجام دهد. گوگل با پیشروی با آموزش های خصمانه و پادمان های لایه ای، سعی دارد به خریداران سازمانی که در واگذاری کنترل مکان نما به هوش مصنوعی مردد بوده اند، اطمینان دهد.

چرا استفاده از کامپیوتر به میدان جنگ تبدیل شده است

استفاده از رایانه Gemini 3.5 Flash زمانی که آزمایشگاه‌های اصلی هوش مصنوعی به رقابت می‌پردازند تا عواملی را بسازند که به جای پاسخ دادن به سؤالات، کار مفیدی انجام دهند، وارد می‌شود. Anthropic در اواخر سال 2024 ابزار استفاده از رایانه را برای Claude معرفی کرد و اپراتور و محصولات عامل OpenAI در همین مسیر حرکت کردند. بومی ساختن این قابلیت برای یک مدل سریع و مقرون به صرفه مانند Flash - به جای رزرو آن برای یک سطح برتر - نشان می دهد که Google می خواهد کنترل عامل را به سرعت کالایی کند.

انتخاب فلش به خودی خود قابل توجه است. Flash مدل سطح کارایی گوگل است که برای سرعت و هزینه بهینه شده است. تعبیه استفاده از رایانه در آنجا، نه فقط در مدل بزرگتر Pro، نشان می‌دهد که Google انتظار بارهای کاری با حجم بالا و حساس به تأخیر را دارد - نوعی که وظایف تکراری را در نرم‌افزارهای تجاری در مقیاس خودکار می‌کند.

گوگل اعلام کرد که در حال حاضر شاهد افزایش ارزش مشتریان با استفاده از رایانه است، اگرچه در این پست وبلاگ به استقرار تجاری خاصی اشاره نشده است یا نتایج را کمی بیان نمی کند.

سهام رقابتی

برای توسعه دهندگان، جذابیت یک ابزار داخلی برای استفاده از رایانه ساده است: ادغام های کمتری برای نگهداری و یک فروشنده واحد مسئول هم برای مدل و هم برای لایه عامل. اما وابستگی به پلتفرم گوگل را نیز عمیق‌تر می‌کند، معامله‌ای که شرکت‌ها در برابر انعطاف‌پذیری چارچوب‌های عامل مدل-آگنوستیک می‌سنجید.

انتشار همچنین تنش گسترده تری را در اقتصاد عامل تشدید می کند. دروازه‌های عامل منبع باز توسعه یافته مستقل، مانند چارچوب Lightport که چندین ارائه‌دهنده LLM را با OpenAI سازگار می‌کند، نشان می‌دهد که چقدر تقاضا برای زیرساخت عامل قابل حمل وجود دارد. شرط گوگل این است که یک ابزار استفاده از کامپیوتر شخص اول و سخت افزاری ایمنی، بر توسعه دهندگانی که در غیر این صورت ابزارهای شخص ثالث را به هم متصل می کنند، پیروز خواهد شد. همانطور که مدل‌ها توانایی عمل بر روی صفحه‌نمایش را به دست می‌آورند، خط بین دستیار هوش مصنوعی و اپراتور مستقل همچنان محو می‌شود - و همچنین مرز بین پیشرفت بهره‌وری و مسئولیت امنیتی محو می‌شود. پاسخ گوگل به این تنش، حفاظت لایه ای و آموزش خصمانه است. اینکه آیا این برای رضایت شرکت‌های ریسک‌گریز کافی است یا خیر، تعیین می‌کند که عوامل استفاده‌کننده از رایانه با چه سرعتی از دمو به استفاده روزانه می‌روند.

گوگل با Gemini 3.5 Flash شرط بندی واضحی کرده است: آینده هوش مصنوعی فقط مدل هایی نیست که جواب می دهند، بلکه مدل هایی هستند که عمل می کنند – و از توسعه دهندگان می خواهد که این مدل های بازیگری را روی پلتفرم خود بسازند.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →