Patronus AI, startup, který vytváří simulovaná digitální prostředí pro hodnocení autonomních agentů AI, získal 50 milionů dolarů v kole série B, protože poptávka po spolehlivém testování agentů prudce vzrostla. Kolo vedly Greenfield Partners za účasti Notable Capital, Lightspeed, Datadog a Samsung, uvedl TechCrunch, čímž se celkové financování společnosti zvýšilo na 70 milionů dolarů.
Nový problém: Agenti, kteří používají zkratky For more context on this story, see our ongoing AI trends.
Jak se agenti umělé inteligence vyvíjejí od odpovídání na otázky k autonomnímu provádění složitých, vícestupňových úkolů, poskytovatelé modelů a startupy vytvářející takové agenty potřebují ujištění, že systémy budou spolehlivě fungovat v široké škále scénářů. Laboratoře umělé inteligence často používají benchmarky, aby předvedly zdatnost modelu, ale vysoké skóre v benchmarku zaměřeném na agenty nedokazuje, že umělá inteligence může skutečně správně plnit úkoly v reálném světě.
Na tuto mezeru se zaměřuje Patronus AI. Společnost se sídlem v San Franciscu, založená v roce 2023 bývalými výzkumníky Meta AI Anandem Kannappanem a Rebeccou Qian, staví to, co nazývá „modely digitálního světa“, repliky webových stránek a interních systémů, ve kterých jsou agenti po školení zátěžově testováni. Agenti jsou hodnoceni pomocí posilovacího učení, které iterativně odměňuje úspěšné dokončení úkolu a penalizuje chyby.
Půjčky od autonomních vozidel
Společnost porovnává svůj přístup s tím, jak Waymo trénoval samořídící auta, nejprve stavěl syntetické světy, aby testoval vozidla proti vzácným nebezpečím, jako je nepříznivé počasí nebo dítě běžící za míčem. Klíčový rozdíl od agentů AI je v tom, že mají tendenci používat zkratky, což znamená, že nedokážou správně dokončit úkoly, i když se zdá, že jsou úspěšní.
"Patronus je opravdu dobrý v odhalování hacků a ujišťování se, že vedou modely k odpovědnosti," řekl Glenn Solomon, výkonný ředitel společnosti Notable Capital. Solomon popsal poptávku po simulovaných prostředích společnosti jako téměř neukojitelnou. Prakticky každá laboratoř hraniční umělé inteligence a mnoho nově vznikajících startupů jsou nyní zákazníky a tržby společnosti Patronus vzrostly za poslední rok 15krát.
Rozšíření nad rámec ověřitelných úkolů
Patronus v současné době poskytuje své simulované digitální světy pro softwarové inženýrství a finance, což jsou dvě oblasti, kde lze výsledky relativně snadno ověřit. Společnost to však považuje pouze za začátek. "Dnes se velmi zaměřujeme na problémy, které jsou ověřitelné, na problémy, které můžete okamžitě zkontrolovat a ověřit, ale existuje spousta dalších oblastí, které jsou velmi neověřitelné nebo velmi obtížně ověřitelné," řekl Kannappan.
Ambicí je vybudovat dostatečně podstatná prostředí pro testování agentů v dlouhodobém horizontu. "Chceme být schopni skutečně vytvořit prostředí, ve kterém můžete provozovat agenta, který může běžet 10 hodin nebo 10 dní nebo 10 týdnů," řekl Kannappan. To, že jsou procesy ověřitelné, neznamená, že jsou jednoduché, a schopnost zachytit agenta, který selže během několikadenního pracovního postupu, je ústředním bodem nabídky společnosti.
Financování také přichází, když se širší průmysl AI potýká s tím, jak měřit pokrok. Srovnávací výsledky se staly spornou měnou a kritici tvrdí, že modely lze optimalizovat pro testy specifické pro hru, aniž by se skutečně zlepšovaly ve skutečných úkolech. Simulovaná prostředí společnosti Patronus nabízejí alternativu, testovací agenty v otevřených scénářích, kde jediným důkazem úspěchu je správně dokončená práce spíše než číslo ve výsledkové tabulce.
Pro podnikové zákazníky je toto rozlišení důležité. Kódovací agent, který projde benchmarkem, ale tiše zavádí chyby do produkční kódové základny, nebo finanční agent, který nesprávně zaokrouhluje čísla, může způsobit mnohem větší škody, než by naznačovalo nízké skóre testu. Tím, že Patronus zachytí tato selhání v karanténě před nasazením, umístí hodnocení jako předpoklad důvěry, nikoli jako dodatečný nápad.
Odlišný přístup v přeplněném poli
Pokud jde o soupeře, Patronus se domnívá, že primárně soutěží s interními hodnotícími týmy, které již vytvořily laboratoře umělé inteligence pro hodnocení chování agentů. Zatímco firmy zabývající se lidskými daty, jako je Mercor a Surge, pomáhají tvůrcům modelů s učením se posílením, Patronus funguje odlišně tím, že vyhodnocuje, jak se agenti chovají bez jakéhokoli lidského zásahu, a automatizuje detekci selhání, která by jinak vyžadovala nákladnou ruční kontrolu.
Kolo signalizuje důvěru investorů, že hodnocení agentů se stane základní vrstvou AI stacku. S tím, jak agenti přebírají autonomnější práci, od rezervace výletů po provádění finančních analýz, začínají startupy schopné prokázat, že tyto systémy jsou důvěryhodné, než budou nasazeny, a staví se jako nepostradatelné strážce éry agentů AI.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →


