Το Google DeepMind έχει μετατρέψει τη χρήση υπολογιστή σε ένα ενσωματωμένο εργαλείο μέσα στο Gemini 3.5 Flash, δίνοντας στους προγραμματιστές έναν εγγενή τρόπο να δημιουργήσουν πράκτορες τεχνητής νοημοσύνης που μπορούν να αλληλεπιδρούν με λογισμικό σε όλες τις πλατφόρμες χωρίς να βιδώνουν σε πλαίσια τρίτων.
Η ανακοίνωση, που δημοσιεύτηκε στις 24 Ιουνίου 2026 στο επίσημο ιστολόγιο Λέξεων-κλειδιών της Google, τοποθετεί το Gemini 3.5 Flash ως υποψήφιο στην ταχέως κινούμενη αγορά για πράκτορες που μπορούν να δουν μια οθόνη, να μετακινήσουν τον κέρσορα, να κάνουν κλικ και να πληκτρολογήσουν — δυνατότητες που μέχρι πρόσφατα απαιτούσαν σημαντική προσαρμοσμένη μηχανική. For more context on this story, see our ongoing artificial intelligence updates.
"Η χρήση υπολογιστή είναι πλέον ένα ενσωματωμένο εργαλείο στο Gemini 3.5 Flash για τη δημιουργία πρακτόρων που μπορούν να αλληλεπιδρούν σε όλες τις πλατφόρμες", έγραψε η εταιρεία. Η ανάρτηση συντάχθηκε από τον Mateo Quiros, υπεύθυνο προϊόντων στο Google DeepMind.
Πώς λειτουργεί
Η χρήση υπολογιστή επιτρέπει σε ένα μοντέλο να χειρίζεται έναν υπολογιστή όπως θα έκανε ένας άνθρωπος: ερμηνεύοντας αυτό που εμφανίζεται στην οθόνη και πραγματοποιώντας ενέργειες όπως κλικ, κύλιση και εισαγωγή κειμένου. Ενσωματώνοντας τη δυνατότητα απευθείας στο Gemini 3.5 Flash αντί να το προσφέρει ως ξεχωριστό προϊόν, η Google μειώνει το εμπόδιο για τους προγραμματιστές που θέλουν να δημιουργήσουν πράκτορες που πλοηγούνται σε πραγματικές εφαρμογές, ιστότοπους και λειτουργικά συστήματα.
Σύμφωνα με την ανάρτηση ιστολογίου, οι προγραμματιστές και οι επιχειρήσεις μπορούν να αρχίσουν να χρησιμοποιούν υπολογιστή σε Flash 3.5 μέσω του Gemini API και της πλατφόρμας Gemini Enterprise Agent, του αποκλειστικού περιβάλλοντος της Google για τη δημιουργία και την ανάπτυξη πρακτόρων σε κλίμακα.
Η Google έδειξε την ικανότητα με συγκεκριμένες περιπτώσεις χρήσης. Σε ένα παράδειγμα, το Gemini 3.5 Flash χρησιμοποίησε χρήση υπολογιστή για να αναλύσει την ίδια την εφαρμογή Gemini και να επιστρέψει μια κατηγοριοποιημένη λίστα χαρακτηριστικών. Σε ένα άλλο, το μοντέλο έλεγξε τη δική του τεκμηρίωση για ζητήματα προσβασιμότητας - μια εργασία αυτοαναφοράς που υποδηλώνει πώς οι πράκτορες που χρησιμοποιούν υπολογιστή θα μπορούσαν μια μέρα να βοηθήσουν στη διατήρηση των οικοσυστημάτων λογισμικού στα οποία εκτελούνται.
Ασφάλεια: Εκπαίδευση σε αντιπάλους και προσέγγιση «άμυνας σε βάθος»
Το πιο σημαντικό μέρος της κυκλοφορίας μπορεί να είναι αυτό που είπε η Google για την ασφάλεια. Οι πράκτορες που λειτουργούν σε ζωντανά περιβάλλοντα είναι μοναδικά ευάλωτοι σε άμεση έγχυση — επιθέσεις στις οποίες κρυφές οδηγίες που είναι ενσωματωμένες σε μια ιστοσελίδα, ηλεκτρονικό ταχυδρομείο ή έγγραφο παραβιάζουν τον πράκτορα για να προβεί σε ανεπιθύμητες ενέργειες.
Η Google είπε ότι χρησιμοποίησε στοχευμένη εκπαίδευση αντιπάλου για χρήση υπολογιστή στο Gemini 3.5 Flash για να μετριάσει αυτούς τους κινδύνους. Κυκλοφορεί επίσης δύο προαιρετικά συστήματα προστασίας της επιχείρησης που η εταιρεία είπε ότι επιτρέπουν στους οργανισμούς να ελέγχουν καλύτερα τι μπορούν να κάνουν οι αντιπρόσωποί τους.
Ακολουθώντας μια προσέγγιση "άμυνας σε βάθος", η Google ενθάρρυνε τους προγραμματιστές να συνδυάσουν αυτές τις λειτουργίες με ασφαλή sandboxing, επαλήθευση από τον άνθρωπο σε βρόχο και αυστηρούς ελέγχους πρόσβασης. Η εταιρεία δημοσίευσε πρόσθετες οδηγίες στην τεκμηρίωση βέλτιστων πρακτικών για το χαρακτηριστικό.
Αυτό το πλαίσιο έχει σημασία. Η χρήση υπολογιστή θεωρείται ευρέως ως μία από τις πιο επικίνδυνες δυνατότητες πρακτόρων που πρέπει να αναπτυχθούν, επειδή ένας παραβιασμένος πράκτορας μπορεί να πραγματοποιήσει ενέργειες πραγματικού κόσμου μέσα στους λογαριασμούς και τα συστήματα ενός χρήστη. Η Google ηγείται με εκπαίδευση για αντιπάλους και πολυεπίπεδες διασφαλίσεις, η Google προσπαθεί να καθησυχάσει τους επιχειρηματικούς αγοραστές που διστάζουν να παραδώσουν τον έλεγχο ενός δρομέα σε μια τεχνητή νοημοσύνη.
Γιατί η χρήση του υπολογιστή γίνεται πεδίο μάχης
Η χρήση υπολογιστή του Gemini 3.5 Flash φτάνει καθώς τα μεγάλα εργαστήρια τεχνητής νοημοσύνης αγωνίζονται να δημιουργήσουν πράκτορες που μπορούν να κάνουν χρήσιμη δουλειά αντί να απαντούν απλώς σε ερωτήσεις. Η Anthropic παρουσίασε ένα εργαλείο χρήσης υπολογιστή για τον Claude στα τέλη του 2024 και τα προϊόντα χειριστή και αντιπροσώπων του OpenAI έχουν ωθήσει προς την ίδια κατεύθυνση. Η δημιουργία της δυνατότητας εγγενής σε ένα γρήγορο, οικονομικά αποδοτικό μοντέλο όπως το Flash — αντί να το δεσμεύσετε για ένα premium επίπεδο — σηματοδοτεί ότι η Google θέλει να εμπορευματοποιήσει γρήγορα τον έλεγχο αντιπροσώπων.
Η επιλογή του Flash είναι από μόνη της αξιοσημείωτη. Το Flash είναι το μοντέλο επιπέδου αποδοτικότητας της Google, βελτιστοποιημένο για ταχύτητα και κόστος. Η ενσωμάτωση της χρήσης υπολογιστή εκεί, και όχι μόνο στο μεγαλύτερο μοντέλο Pro, υποδηλώνει ότι η Google αναμένει φόρτους εργασίας παράγοντα μεγάλου όγκου, ευαίσθητου σε λανθάνουσα κατάσταση — το είδος που αυτοματοποιεί επαναλαμβανόμενες εργασίες σε επιχειρηματικό λογισμικό σε κλίμακα.
Η Google είπε ότι ήδη βλέπει τους πελάτες να αυξάνουν την αξία τους με τη χρήση υπολογιστή, αν και η ανάρτηση ιστολογίου δεν κατονομάζει συγκεκριμένες εμπορικές αναπτύξεις ούτε ποσοτικοποιεί τα αποτελέσματα.
Τα ανταγωνιστικά στοιχήματα
Για τους προγραμματιστές, η ελκυστικότητα ενός ενσωματωμένου εργαλείου χρήσης υπολογιστή είναι απλή: λιγότερες ενσωματώσεις για συντήρηση και ένας μόνο προμηθευτής υπεύθυνος τόσο για το μοντέλο όσο και για το επίπεδο αντιπροσώπου. Ωστόσο, εμβαθύνει επίσης την εξάρτηση από την πλατφόρμα της Google, μια αντιστάθμιση που οι επιχειρήσεις θα σταθμίσουν έναντι της ευελιξίας των πλαισίων αγνωστικιστών μοντέλων.
Η κυκλοφορία οξύνει επίσης μια ευρύτερη ένταση στην οικονομία των πρακτόρων. Ανεξάρτητα αναπτυγμένες πύλες πρακτόρων ανοιχτού κώδικα, όπως το πλαίσιο Lightport που κάνει πολλούς παρόχους LLM συμβατούς με OpenAI, δείχνουν πόση ζήτηση υπάρχει για υποδομή φορητών πρακτόρων. Το στοίχημα της Google είναι ότι ένα εργαλείο χρήσης υπολογιστή πρώτου κατασκευαστή, ενισχυμένο με ασφάλεια, θα κερδίσει τους προγραμματιστές που διαφορετικά θα συνδύαζαν εργαλεία τρίτων. Καθώς τα μοντέλα αποκτούν την ικανότητα να ενεργούν σε οθόνες, η γραμμή μεταξύ ενός βοηθού τεχνητής νοημοσύνης και ενός αυτόνομου χειριστή συνεχίζει να θολώνει — και το ίδιο ισχύει και για τη γραμμή μεταξύ μιας σημαντικής ανακάλυψης παραγωγικότητας και μιας ευθύνης ασφαλείας. Η απάντηση της Google σε αυτή την ένταση είναι πολυεπίπεδες διασφαλίσεις και εκπαίδευση αντιπάλων. Το αν αυτό είναι αρκετό για να ικανοποιήσει τις επιχειρήσεις που αποστρέφονται τον κίνδυνο θα καθορίσει πόσο γρήγορα οι πράκτορες που χρησιμοποιούν υπολογιστές θα μετακινηθούν από το demo στην καθημερινή χρήση.
Με το Gemini 3.5 Flash, η Google έχει βάλει ένα ξεκάθαρο στοίχημα: το μέλλον της τεχνητής νοημοσύνης δεν είναι μόνο τα μοντέλα που απαντούν, αλλά τα μοντέλα που ενεργούν — και θέλει τους προγραμματιστές να κατασκευάζουν αυτά τα μοντέλα υποκριτικής στην πλατφόρμα της.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →


