Benchmarky umělé inteligence rozhodují o tom, které modely se dostanou na titulky – a společnosti, které tyto modely vytvářejí, se naučily, jak je porazit. Startup s názvem Vals, který byl založen v roce 2024, sází na to, že průmysl potřebuje rozhodčího, jehož testy nelze hrát, a investoři tuto sázku právě podpořili velkým způsobem: Vals minulý měsíc získal 40 milionů dolarů v sérii A pod vedením Andreessena Horowitze po počátečním kole vedeném 8VC a Bloomberg Beta.
Vzestup společnosti přichází uprostřed rostoucího znepokojení nad tím, jak se měří schopnosti umělé inteligence a co se stane, když se měřítko stane marketingovým nástrojem. Další informace o podnikání v oblasti umělé inteligence naleznete v Pokrytí odvětví AI.
Když se benchmarky stanou marketingem
Benchmarking se stal průmyslovou normou pro ověřování schopností modelů umělé inteligence – a když se čísla mění v cestě společnosti, pro propagaci převahy nad konkurenty. Dobré měřítka znamenají dobré vztahy s veřejností.
Problém je podle spoluzakladatele a generálního ředitele Vals Rayana Krishnana v tom, že mnoho starších benchmarků bylo vytvořeno pro dřívější generaci modelů a společnosti přišly na to, jak se proti nim optimalizovat. Když jsou testovací materiály veřejné, lze model efektivně vycvičit, aby složil zkoušku – praktiku, kterou průmysl různě popsal jako kontaminaci, nadměrné vybavení nebo přímé podvádění.
"Byli jsme svědky toho, že se na trh rychle dostala spousta nových, velmi schopných modelů a akademická měřítka [nebyla] v souladu s tímto pokrokem na hranici," řekl Krishnan v rozhovoru pro TechCrunch.
Soukromé testy, úkoly ze skutečného světa
Vals má odlišný přístup na dvou frontách. Za prvé, nezveřejňuje své specifické testovací materiály, což firmám značně ztěžuje trénovat své modely proti zkoušce. Zadruhé, namísto měření abstraktních znalostí – zda model dokáže odpovědět na otázky ve stylu barových zkoušek – Vals hodnotí, jak modely plní složité úkoly v konkrétních odvětvích, jako je právo, finance a kódování.
"To, co děláme, je vlastně zkoumání toho, jaké jsou skutečné dopady modelů," řekl Krishnan. "Mohou dělat práci, která produkuje produkt stejné kvality jako člověk v každé doméně?"
Společnost také měří způsoby selhání, nejen úspěchy. Krishnan řekl, že Vals si klade za cíl analyzovat „pokud by se tyto modely ve světě rozběhly divoce, jaké by to mělo negativní důsledky“ – filozofii hodnocení, která považuje riziko poklesu za měřitelný výstup spíše než jako dodatečný nápad.
Od práva a financí k Ženevským konvencím a rekurzivnímu sebezdokonalování
Rozsah hodnocení společnosti Vals se neustále rozšiřuje mimo její kořeny v oblasti profesionálních služeb. Krishnan uvedl, že kromě srovnávacích testů v oblasti práva, financí a kódování nyní společnost provádí testy duševního zdraví, kybernetické a biologické bezpečnosti a dokonce i benchmark rekurzivního sebezdokonalování – téma, o kterém se častěji diskutuje v kruzích bezpečnosti AI než v komerčních vyhodnocovacích sadách.
Snad nejpozoruhodnější je jeho práce na právu ozbrojených konfliktů, kde Vals testuje, jak modely chápou a uplatňují Ženevskou konvenci. Šířka signalizuje, odkud přichází poptávka: nejen laboratoře závodící na předních žebříčcích, ale i podniky a instituce, které před nasazením potřebují důkazy o tom, jak se modely chovají v oblastech s vysokými sázkami.
Obchodní model: Zaplaťte za test
Společnosti platí Valsovi, aby zhodnotil jejich modely – toto uspořádání se může zdát kontraintuitivní. Proč by společnost platila za výsledky, které by ji mohly uvést do rozpaků? Krishnan přirovnává model ke studentovi, který platí College Board za SAT: nezávislé měření, i když nelichotivé, pomáhá společnosti řešit problémy a časem se zlepšovat.
Zdá se, že trh reaguje. Vals říká, že její tržby jsou v současnosti osmkrát vyšší než loni a její tým se od začátku roku ztrojnásobil, z osmi lidí na 25. Společnost působí z dvoupatrové kanceláře na sanfranciské Folsom Street — bývalé budově pivovaru, kde nyní sídlí několik startupů.
Hodnocení se podle společnosti také stávají rozhodovacími faktory pro podniky nakupující modely umělé inteligence, což dává benchmarkům roli blíže k due diligence než marketingu.
25letý zakladatel se sedadlem v přední řadě
Krishnan, 25, byl internován v Palantir a jako vysokoškolák na Stanfordu pracoval pro Microsoft a známou univerzitní laboratoř umělé inteligence. Říká, že Vals se zrodil ze sledování, jak hodnocení zaostává za průmyslem, který mělo měřit – propast, která se jen zvětšila, když nové modely přicházejí rychleji, než lze navrhnout, ověřit a publikovat akademické benchmarky.
Startup se nyní připojuje k malé, ale rostoucí kohortě společností, které se snaží institucionalizovat hodnocení umělé inteligence, prostor, který zahrnuje akademické úsilí, open source projekty s žebříčky a bezpečnostní instituty. To, co Vals odlišuje, je jeho model soukromých testů a jeho zaměření na placená, oborově specifická hodnocení spíše než na veřejné hodnocení.
Proč na tom záleží
Problém důvěryhodnosti odvětví AI s benchmarky je dobře zdokumentován: uniklé testovací sady, podezřelé skoky v žebříčku a marketingová tvrzení, která překonávají výkon v reálném světě. Pokud se kupující – zejména podniky a vlády – začnou spoléhat na soukromé hodnocení založené na úkolech, jako je Vals, pobídky pro vývojáře modelů by se mohly přesunout od výuky k testování směrem ke skutečné schopnosti.
To má k vypořádání hodně daleko. Soukromý benchmark stále žádá kupující, aby důvěřovali rozhodčímu, a Valsovými klienty jsou stejné společnosti, které jsou hodnoceny. Ale s 40 miliony dolarů Series A, osminásobným růstem tržeb a poptávkou zahrnující finance až po biologickou bezpečnost je sázka na to, že nezávislé hodnocení se stává infrastrukturou – službou, za kterou ekonomika AI zaplatí, ať už jí výsledky lichotí, nebo ne.
Udržujte si náskok před AI
Kdo měří měřiče? Sledujte podnikání v oblasti hodnocení umělé inteligence a startupů, které je přetvářejí, na AI Buzz Wire, vašemu zdroji nejnovějších zpráv o AI.
Přečtěte si nejnovější zprávy o AI →