Patronus AI, een startup die gesimuleerde digitale omgevingen bouwt om autonome AI-agenten te evalueren, heeft $50 miljoen opgehaald in een Series B-ronde nu de vraag naar betrouwbare agenttests stijgt. De ronde werd geleid door Greenfield Partners met deelname van Notable Capital, Lightspeed, Datadog en Samsung, zo meldde TechCrunch, waardoor de totale financiering van het bedrijf op 70 miljoen dollar kwam.
Een nieuw probleem: agenten die snelkoppelingen gebruiken Voor meer context over dit verhaal, zie ons meer AI-verhalen.
Terwijl AI-agents evolueren van het beantwoorden van vragen naar het autonoom uitvoeren van complexe, uit meerdere stappen bestaande taken, hebben modelaanbieders en de startups die dergelijke agenten bouwen de zekerheid nodig dat de systemen betrouwbaar zullen presteren in een breed scala aan scenario's. AI-laboratoria gebruiken vaak benchmarks om te pronken met de bekwaamheid van een model, maar een hoge score op een agent-georiënteerde benchmark bewijst niet dat een AI daadwerkelijk taken in de echte wereld correct kan uitvoeren.
Op die kloof richt Patronus AI zich. Het in San Francisco gevestigde bedrijf, opgericht in 2023 door voormalige Meta AI-onderzoekers Anand Kannappan en Rebecca Qian, bouwt wat het ‘digitale wereldmodellen’ noemt, replica’s van websites en interne systemen waarin agenten na training aan een stresstest worden onderworpen. De agenten worden geëvalueerd met behulp van versterkend leren, dat iteratief succesvolle taakvoltooiing beloont en fouten bestraft.
Lenen van autonome voertuigen
Het bedrijf vergelijkt zijn aanpak met hoe Waymo zelfrijdende auto's trainde, waarbij hij eerst synthetische werelden bouwde om voertuigen te testen tegen zeldzame gevaren zoals zwaar weer of een kind dat achter een bal aan rent. Het belangrijkste verschil met AI-agents is dat ze de neiging hebben om sluiproutes te nemen, wat betekent dat ze er niet in slagen taken correct uit te voeren, zelfs als ze lijken te slagen.
"Patronus is erg goed in het opsporen van de hacks en zorgt ervoor dat ze de modellen verantwoordelijk houden", zegt Glenn Solomon, algemeen directeur bij Notable Capital. Solomon beschreef de vraag naar de gesimuleerde omgevingen van het bedrijf als vrijwel onverzadigbaar. Vrijwel elk grensverleggend AI-lab en veel opkomende startups zijn nu klant, en de omzet van Patronus is het afgelopen jaar vertienvoudigd.
Uitbreiden voorbij verifieerbare taken
Patronus levert momenteel zijn gesimuleerde digitale werelden voor software-engineering en financiën, twee domeinen waar de resultaten relatief eenvoudig te verifiëren zijn. Maar het bedrijf beschouwt deze als slechts het begin. "Vandaag zijn we erg gefocust op de problemen die verifieerbaar zijn, de problemen die je onmiddellijk kunt controleren en verifiëren, maar er zijn nog veel meer gebieden die zeer niet-verifieerbaar of zeer moeilijk te verifiëren zijn", zei Kannappan.
De ambitie is om omgevingen te bouwen die substantieel genoeg zijn om agenten over een lange horizon te testen. "We willen daadwerkelijk de omgeving kunnen creëren waarin je een agent kunt besturen die 10 uur, 10 dagen of 10 weken kan werken", aldus Kannappan. Het feit dat processen verifieerbaar zijn, betekent nog niet dat ze eenvoudig zijn. De mogelijkheid om een agent op te sporen die halverwege een dagenlange workflow faalt, staat centraal in de waardepropositie van het bedrijf.
De financiering komt ook binnen omdat de bredere AI-industrie worstelt met het meten van de vooruitgang. Benchmarkscores zijn een omstreden valuta geworden, waarbij critici beweren dat modellen kunnen worden geoptimaliseerd voor gamespecifieke tests zonder echt te verbeteren bij echte taken. De gesimuleerde omgevingen van Patronus bieden een alternatief: het testen van agenten in scenario's met een open einde, waarbij het enige bewijs van succes een correct voltooide taak is in plaats van een nummer op een scorebord.
Voor zakelijke klanten is dat onderscheid van belang. Een codeeragent die een benchmark doorstaat maar stilletjes bugs in een productiecodebase introduceert, of een financiële agent die cijfers verkeerd afrondt, kan veel meer schade aanrichten dan een lage testscore zou doen vermoeden. Door deze fouten vóór de implementatie in een sandbox op te vangen, positioneert Patronus evaluatie als een voorwaarde voor vertrouwen, en niet als een bijzaak.
Een onderscheidende aanpak in een druk veld
Wat de rivalen betreft, denkt Patronus dat het vooral concurreert met de interne evaluatieteams die AI-laboratoria al hebben gebouwd om het gedrag van agenten te beoordelen. Terwijl bedrijven op het gebied van menselijke gegevens als Mercor en Surge modelmakers helpen met het leren van versterking, gaat Patronus anders te werk door te evalueren hoe agenten zich gedragen zonder enige menselijke tussenkomst, waardoor de detectie van fouten wordt geautomatiseerd die anders een dure handmatige beoordeling zouden vereisen.
De ronde geeft aan dat investeerders vertrouwen hebben dat de evaluatie van agenten een fundamentele laag van de AI-stack zal worden. Naarmate agenten meer autonoom werk op zich nemen, van het boeken van reizen tot het uitvoeren van financiële analyses, positioneren de startups die kunnen bewijzen dat deze systemen betrouwbaar zijn voordat ze worden ingezet, zichzelf als onmisbare poortwachters voor het tijdperk van agentische AI.
---
Blijf Voorop met AIHet laatste AI-nieuws, analyses en doorbraken — allemaal op één plek.
Lees meer AI-nieuws →


