Patronus AI, o companie startup care construiește medii digitale simulate pentru a evalua agenții AI autonomi, a strâns 50 de milioane de dolari într-o rundă de Seria B, deoarece cererea de testare a agenților de încredere crește. Runda a fost condusă de Greenfield Partners, cu participarea Notable Capital, Lightspeed, Datadog și Samsung, a raportat TechCrunch, ceea ce a adus finanțarea totală a companiei la 70 de milioane de dolari.
O nouă problemă: agenți care iau comenzi rapide For more context on this story, see our ongoing AI industry coverage.
Pe măsură ce agenții AI evoluează de la răspunsul la întrebări la executarea autonomă a sarcinilor complexe, în mai mulți pași, furnizorii de modele și startup-urile care construiesc astfel de agenți au nevoie de asigurarea că sistemele vor funcționa fiabil într-o gamă largă de scenarii. Laboratoarele de inteligență artificială folosesc adesea benchmark-uri pentru a arăta priceperea unui model, dar un scor mare la un benchmark orientat pe agenți nu dovedește că un AI poate îndeplini corect sarcinile din lumea reală.
Acest decalaj este locul în care se concentrează Patronus AI. Fondată în 2023 de foștii cercetători Meta AI Anand Kannappan și Rebecca Qian, compania din San Francisco construiește ceea ce numește „modele de lume digitală”, replici ale site-urilor web și sisteme interne în care agenții sunt testați la stres după antrenament. Agenții sunt evaluați folosind învățare prin întărire, care recompensează în mod iterativ finalizarea cu succes a sarcinii și penalizează erorile.
Împrumut de la vehicule autonome
Compania compară abordarea sa cu modul în care Waymo a antrenat mașinile autonome, construind mai întâi lumi sintetice pentru a testa vehiculele împotriva pericolelor rare, cum ar fi vremea severă sau un copil care alergă după o minge. Diferența cheie cu agenții AI este că aceștia tind să ia comenzi rapide, ceea ce înseamnă că nu reușesc să îndeplinească sarcinile corect, chiar și atunci când par să reușească.
„Patronus este foarte bun să detecteze hackurile și să se asigure că aceștia țin modelele la răspundere”, a declarat Glenn Solomon, director general la Notable Capital. Solomon a descris cererea pentru mediile simulate ale companiei ca fiind aproape nesățioasă. Practic, fiecare laborator AI de frontieră și multe startup-uri emergente sunt acum clienți, iar veniturile Patronus au crescut de 15 ori în ultimul an.
Extinderea dincolo de sarcinile verificabile
Patronus oferă în prezent lumile sale digitale simulate pentru inginerie software și finanțe, două domenii în care rezultatele sunt relativ ușor de verificat. Dar compania le vede ca doar începutul. „Astăzi suntem foarte concentrați pe problemele care sunt verificabile, problemele pe care le puteți verifica și verifica imediat, dar există o mulțime de zone care sunt foarte neverificabile sau foarte greu de verificat”, a spus Kannappan.
Ambiția este de a construi medii suficient de substanțiale pentru a testa agenți pe orizonturi lungi. „Vrem să fim capabili să creăm mediul în care puteți opera un agent care poate rula timp de 10 ore sau 10 zile sau 10 săptămâni”, a spus Kannappan. Doar pentru că procesele sunt verificabile nu înseamnă că sunt simple, iar capacitatea de a surprinde un agent care eșuează la jumătatea unui flux de lucru de o zi este esențială pentru propunerea de valoare a companiei.
Finanțarea vine, de asemenea, pe măsură ce industria mai largă AI se luptă cu modul de măsurare a progresului. Scorurile de referință au devenit o monedă contestată, criticii susținând că modelele pot fi optimizate pentru teste specifice jocului fără a se îmbunătăți cu adevărat la sarcinile reale. Mediile simulate Patronus oferă o alternativă, testarea agenților în scenarii deschise, în care singura dovadă a succesului este o lucrare finalizată corect, mai degrabă decât un număr pe un clasament.
Pentru clienții întreprinderi, această distincție contează. Un agent de codare care trece de un etalon de referință, dar introduce în tăcere erori într-o bază de cod de producție, sau un agent financiar care rotunjește cifrele incorect, poate provoca mult mai multe daune decât ar sugera un scor scăzut de test. Prin capturarea acelor eșecuri într-un sandbox înainte de implementare, Patronus poziționează evaluarea ca o condiție prealabilă a încrederii, nu o idee ulterioară.
O abordare distinctă într-un câmp aglomerat
În ceea ce privește rivalii, Patronus crede că concurează în primul rând cu echipele de evaluare internă pe care laboratoarele de inteligență artificială le-au construit deja pentru a evalua comportamentul agenților. În timp ce firmele de date umane precum Mercor și Surge îi ajută pe creatorii de modele cu învățare prin consolidare, Patronus funcționează diferit, evaluând modul în care agenții se comportă fără nicio implicare umană, automatizând detectarea defecțiunilor care altfel ar necesita o revizuire manuală costisitoare.
Runda semnalează investitorilor încrederea că evaluarea agenților va deveni un strat de bază al stivei AI. Pe măsură ce agenții își desfășoară activități mai autonome, de la rezervarea de călătorii până la efectuarea de analize financiare, startup-urile capabile să demonstreze că aceste sisteme sunt de încredere, înainte de a fi implementate, se poziționează ca gardieni indispensabili pentru era AI agentică.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →

