Η Patronus AI, μια startup που δημιουργεί προσομοιωμένα ψηφιακά περιβάλλοντα για την αξιολόγηση αυτόνομων πρακτόρων τεχνητής νοημοσύνης, έχει συγκεντρώσει 50 εκατομμύρια δολάρια σε έναν γύρο της σειράς Β, καθώς η ζήτηση για αξιόπιστες δοκιμές πρακτόρων αυξάνεται. Ο γύρος ηγήθηκε από την Greenfield Partners με συμμετοχή των Notable Capital, Lightspeed, Datadog και Samsung, ανέφερε η TechCrunch, ανεβάζοντας τη συνολική χρηματοδότηση της εταιρείας στα 70 εκατομμύρια δολάρια.

Ένα νέο πρόβλημα: Πράκτορες που χρησιμοποιούν συντομεύσεις For more context on this story, see our ongoing AI trends.

Καθώς οι πράκτορες τεχνητής νοημοσύνης εξελίσσονται από την απάντηση ερωτήσεων στην αυτόνομη εκτέλεση σύνθετων εργασιών πολλαπλών βημάτων, οι πάροχοι μοντέλων και οι νεοφυείς επιχειρήσεις που δημιουργούν τέτοιους πράκτορες χρειάζονται διαβεβαίωση ότι τα συστήματα θα αποδίδουν αξιόπιστα σε ένα ευρύ φάσμα σεναρίων. Τα εργαστήρια τεχνητής νοημοσύνης χρησιμοποιούν συχνά δείκτες αναφοράς για να επιδείξουν την ικανότητα ενός μοντέλου, αλλά μια υψηλή βαθμολογία σε ένα σημείο αναφοράς προσανατολισμένο σε πράκτορες δεν αποδεικνύει ότι μια τεχνητή νοημοσύνη μπορεί πραγματικά να ολοκληρώσει σωστά τις εργασίες του πραγματικού κόσμου.

Αυτό το κενό είναι όπου εστιάζει η Patronus AI. Ιδρύθηκε το 2023 από τους πρώην ερευνητές της Meta AI Anand Kannappan και Rebecca Qian, η εταιρεία με έδρα το Σαν Φρανσίσκο κατασκευάζει αυτό που αποκαλεί "ψηφιακά μοντέλα κόσμου", αντίγραφα ιστότοπων και εσωτερικών συστημάτων στα οποία οι πράκτορες ελέγχονται στρες μετά την εκπαίδευση. Οι πράκτορες αξιολογούνται χρησιμοποιώντας ενισχυτική μάθηση, η οποία επιβραβεύει επαναληπτικά την επιτυχή ολοκλήρωση της εργασίας και τιμωρεί τα λάθη.

Δανεισμός από αυτόνομα οχήματα

Η εταιρεία συγκρίνει την προσέγγισή της με τον τρόπο με τον οποίο η Waymo εκπαίδευσε αυτοοδηγούμενα αυτοκίνητα, κατασκευάζοντας πρώτα συνθετικούς κόσμους για να δοκιμάζουν οχήματα έναντι σπάνιων κινδύνων, όπως κακές καιρικές συνθήκες ή ένα παιδί που τρέχει πίσω από μια μπάλα. Η βασική διαφορά με τους πράκτορες τεχνητής νοημοσύνης είναι ότι τείνουν να λαμβάνουν συντομεύσεις, πράγμα που σημαίνει ότι αποτυγχάνουν να ολοκληρώσουν σωστά τις εργασίες τους ακόμα και όταν φαίνεται να πετυχαίνουν.

"Ο Patronus είναι πολύ καλός στο να εντοπίζει τα hacks και να φροντίζει να φέρουν τα μοντέλα υπόλογα", δήλωσε ο Glenn Solomon, διευθύνων σύμβουλος της Notable Capital. Ο Solomon περιέγραψε τη ζήτηση για τα προσομοιωμένα περιβάλλοντα της εταιρείας ως σχεδόν ακόρεστη. Σχεδόν κάθε συνοριακό εργαστήριο τεχνητής νοημοσύνης και πολλές αναδυόμενες νεοσύστατες επιχειρήσεις είναι πλέον πελάτες και τα έσοδα της Patronus έχουν αυξηθεί 15 φορές τον περασμένο χρόνο.

Επέκταση πέρα από επαληθεύσιμες εργασίες

Η Patronus παρέχει επί του παρόντος τους προσομοιωμένους ψηφιακούς κόσμους της για τη μηχανική λογισμικού και τη χρηματοδότηση, δύο τομείς όπου τα αποτελέσματα είναι σχετικά εύκολο να επαληθευτούν. Αλλά η εταιρεία τα βλέπει αυτά ως μόνο την αρχή. «Σήμερα εστιάζουμε πολύ στα προβλήματα που είναι επαληθεύσιμα, στα προβλήματα που μπορείτε να ελέγξετε και να επαληθεύσετε αμέσως, αλλά υπάρχουν πάρα πολλοί τομείς που είναι πολύ μη επαληθεύσιμοι ή πολύ δύσκολο να επαληθευτούν», είπε ο Kannappan.

Η φιλοδοξία είναι να δημιουργηθούν περιβάλλοντα αρκετά ουσιαστικά για να δοκιμάζουν πράκτορες σε μεγάλους ορίζοντες. «Θέλουμε να είμαστε σε θέση να δημιουργήσουμε πραγματικά το περιβάλλον στο οποίο μπορείτε να χειριστείτε έναν πράκτορα που μπορεί να λειτουργεί για 10 ώρες ή 10 ημέρες ή 10 εβδομάδες», είπε ο Kannappan. Ακριβώς επειδή οι διαδικασίες είναι επαληθεύσιμες δεν σημαίνει ότι είναι απλές και η ικανότητα να συλλάβετε έναν πράκτορα να αποτυγχάνει εν μέρει μέσω μιας πολυήμερης ροής εργασίας είναι κεντρικής σημασίας για την πρόταση αξίας της εταιρείας.

Η χρηματοδότηση έρχεται επίσης καθώς η ευρύτερη βιομηχανία τεχνητής νοημοσύνης αντιμετωπίζει τον τρόπο μέτρησης της προόδου. Οι βαθμολογίες συγκριτικής αξιολόγησης έχουν γίνει ένα αμφισβητούμενο νόμισμα, με τους επικριτές να υποστηρίζουν ότι τα μοντέλα μπορούν να βελτιστοποιηθούν για συγκεκριμένες δοκιμές παιχνιδιού χωρίς να βελτιωθούν πραγματικά σε πραγματικές εργασίες. Τα προσομοιωμένα περιβάλλοντα του Patronus προσφέρουν μια εναλλακτική λύση, δοκιμάζοντας πράκτορες σε ανοιχτά σενάρια όπου η μόνη απόδειξη επιτυχίας είναι μια σωστά ολοκληρωμένη εργασία και όχι ένας αριθμός σε έναν πίνακα κατάταξης.

Για τους εταιρικούς πελάτες, αυτή η διάκριση έχει σημασία. Ένας πράκτορας κωδικοποίησης που περνά ένα σημείο αναφοράς αλλά εισάγει σιωπηλά σφάλματα σε μια βάση κωδικών παραγωγής ή ένας χρηματοοικονομικός πράκτορας που στρογγυλοποιεί εσφαλμένα στοιχεία, μπορεί να προκαλέσει πολύ μεγαλύτερη ζημιά από ό,τι υποδηλώνει μια χαμηλή βαθμολογία δοκιμής. Εντοπίζοντας αυτές τις αποτυχίες σε ένα sandbox πριν από την ανάπτυξη, η Patronus τοποθετεί την αξιολόγηση ως προϋπόθεση για την εμπιστοσύνη και όχι ως μεταγενέστερη σκέψη.

Μια ξεχωριστή προσέγγιση σε ένα πολυσύχναστο πεδίο

Όσον αφορά τους αντιπάλους, η Patronus πιστεύει ότι ανταγωνίζεται πρωτίστως τις εσωτερικές ομάδες αξιολόγησης που έχουν ήδη δημιουργήσει τα εργαστήρια τεχνητής νοημοσύνης για την αξιολόγηση της συμπεριφοράς των πρακτόρων. Ενώ εταιρείες ανθρωπίνων δεδομένων όπως η Mercor και η Surge βοηθούν τους κατασκευαστές μοντέλων με την ενίσχυση της μάθησης, η Patronus λειτουργεί διαφορετικά αξιολογώντας τον τρόπο συμπεριφοράς των πρακτόρων χωρίς ανθρώπινη συμμετοχή, αυτοματοποιώντας τον εντοπισμό αστοχιών που διαφορετικά θα απαιτούσαν δαπανηρή μη αυτόματη εξέταση.

Ο γύρος σηματοδοτεί την εμπιστοσύνη των επενδυτών ότι η αξιολόγηση των πρακτόρων θα γίνει ένα θεμελιώδες στρώμα της στοίβας AI. Καθώς οι πράκτορες αναλαμβάνουν πιο αυτόνομη δουλειά, από την κράτηση ταξιδιών έως τη διεξαγωγή χρηματοοικονομικών αναλύσεων, οι νεοφυείς επιχειρήσεις που μπορούν να αποδείξουν ότι αυτά τα συστήματα είναι αξιόπιστα, προτού αναπτυχθούν, τοποθετούνται ως απαραίτητοι φύλακες στην εποχή της τεχνητής νοημοσύνης.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →