Patronus AI, en startup som bygger simulerade digitala miljöer för att utvärdera autonoma AI-agenter, har samlat in 50 miljoner dollar i en serie B-runda när efterfrågan på tillförlitliga agenttester ökar. Omgången leddes av Greenfield Partners med deltagande från Notable Capital, Lightspeed, Datadog och Samsung, rapporterade TechCrunch, vilket ger företagets totala finansiering till 70 miljoner dollar.
Ett nytt problem: Agenter som tar genvägar For more context on this story, see our ongoing AI industry coverage.
Eftersom AI-agenter utvecklas från att svara på frågor till att självständigt utföra komplexa, flerstegsuppgifter, behöver modellleverantörer och startups som bygger sådana agenter försäkra sig om att systemen kommer att fungera tillförlitligt i ett stort antal scenarier. AI-labb använder ofta riktmärken för att visa upp en modells skicklighet, men ett högt betyg på ett agentorienterat riktmärke bevisar inte att en AI faktiskt kan utföra verkliga jobb korrekt.
Den luckan är där Patronus AI fokuserar. Det San Francisco-baserade företaget grundades 2023 av tidigare Meta AI-forskare Anand Kannappan och Rebecca Qian och bygger vad det kallar "digitala världsmodeller", kopior av webbplatser och interna system där agenter stresstestas efter utbildning. Agenterna utvärderas med hjälp av förstärkningsinlärning, som iterativt belönar framgångsrika uppgifter och straffar fel.
Lån från autonoma fordon
Företaget jämför sitt tillvägagångssätt med hur Waymo tränade självkörande bilar, först byggde syntetiska världar för att testa fordon mot sällsynta faror som hårt väder eller ett barn som springer efter en boll. Den viktigaste skillnaden med AI-agenter är att de tenderar att ta genvägar, vilket innebär att de misslyckas med att slutföra uppgifter korrekt även när de verkar lyckas.
"Patronus är riktigt bra på att upptäcka hacken och se till att de håller modellerna ansvariga", säger Glenn Solomon, VD på Notable Capital. Solomon beskrev efterfrågan på företagets simulerade miljöer som nästan omättlig. Praktiskt taget alla frontier AI-labb och många nya startups är nu kunder, och Patronus intäkter har vuxit 15 gånger under det senaste året.
Expanderar bortom verifierbara uppgifter
Patronus tillhandahåller för närvarande sina simulerade digitala världar för mjukvaruteknik och ekonomi, två domäner där resultaten är relativt lätta att verifiera. Men företaget ser dessa som bara början. "Idag är vi mycket fokuserade på de problem som är verifierbara, de problem som du omedelbart kan kontrollera och verifiera, men det finns massor av områden som är mycket icke-verifierbara eller mycket svåra att verifiera," sa Kannappan.
Ambitionen är att bygga miljöer som är tillräckligt omfattande för att testa agenter över långa horisonter. "Vi vill faktiskt kunna skapa en miljö där du kan driva en agent som kan köra i 10 timmar eller 10 dagar eller 10 veckor," sa Kannappan. Bara för att processer är verifierbara betyder det inte att de är enkla, och förmågan att fånga en agent som misslyckas halvvägs genom ett dagar långt arbetsflöde är central för företagets värdeerbjudande.
Finansieringen kommer också när den bredare AI-industrin brottas med hur man mäter framsteg. Benchmarkpoäng har blivit en omtvistad valuta, med kritiker som hävdar att modeller kan optimeras för spelspecifika tester utan att genuint förbättras vid verkliga uppgifter. Patronus simulerade miljöer erbjuder ett alternativt testmedel i öppna scenarier där det enda beviset på framgång är ett korrekt utfört jobb snarare än en siffra på en topplista.
För företagskunder är den skillnaden viktig. En kodningsagent som klarar ett riktmärke men tyst introducerar buggar i en produktionskodbas, eller en finansagent som rundar av siffror felaktigt, kan orsaka mycket mer skada än ett lågt testresultat skulle antyda. Genom att fånga dessa misslyckanden i en sandlåda före utplacering, positionerar Patronus utvärdering som en förutsättning för förtroende, inte en eftertanke.
Ett distinkt tillvägagångssätt i ett trångt fält
När det gäller rivaler tror Patronus att det främst tävlar mot de interna utvärderingsteamen som AI-labb redan har byggt för att bedöma agentbeteende. Medan människodataföretag som Mercor och Surge hjälper modelltillverkare med förstärkningsinlärning, fungerar Patronus annorlunda genom att utvärdera hur agenter beter sig utan mänsklig inblandning, och automatisera upptäckten av fel som annars skulle kräva dyr manuell granskning.
Omgången signalerar investerarnas förtroende för att agentutvärdering kommer att bli ett grundläggande lager i AI-stacken. När agenter tar på sig mer självständigt arbete, från att boka resor till att genomföra finansiell analys, positionerar startups som kan bevisa att dessa system är pålitliga, innan de distribueras, sig själva som oumbärliga portvakter till den agentiska AI-eran.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →


