AI-riktmärken avgör vilka modeller som skapar rubriker – och företagen som bygger dessa modeller har lärt sig hur man slår dem. En startup som heter Vals, som bildades 2024, satsar på att branschen behöver en domare vars tester inte kan spelas, och investerare backade bara den satsningen på ett stort sätt: Vals samlade in en serie A på $40 miljoner under ledning av Andreessen Horowitz förra månaden, efter en seedrunda ledd av 8VC och Bloomberg Beta.
Företagets uppgång kommer mitt i växande oro över hur AI-kapaciteten mäts och vad som händer när måttstocken blir ett marknadsföringsverktyg. För mer om AI-verksamheten, följ AI-branschens täckning.
När benchmarks blir marknadsföring
Benchmarking har blivit branschnormen för att validera AI-modellernas kapacitet – och, när siffrorna svänger ett företags väg, för reklamöverlägsenhet gentemot konkurrenter. Bra riktmärken betyder bra PR.
Problemet, enligt Vals medgrundare och VD Rayan Krishnan, är att många äldre benchmarks byggdes för en tidigare generation av modeller, och företag har kommit på hur man kan optimera mot dem. När testmaterial är offentligt kan en modell effektivt tränas för att klara provet - en praxis som industrin på olika sätt har beskrivit som förorening, överanpassad utrustning eller rent fusk.
"Vi såg ett gäng nya, mycket kapabla modeller komma till marknaden snabbt, och de akademiska riktmärkena höll inte jämna steg med det gränsöverskridandet", sa Krishnan i en intervju med TechCrunch.
Privata tester, verkliga uppgifter
Vals har ett annat förhållningssätt på två fronter. För det första avslöjar det inte sitt specifika testmaterial, vilket gör det mycket svårare för ett företag att träna sina modeller mot provet. För det andra, istället för att mäta abstrakt kunskap – om en modell kan svara på frågor i bar-examen – utvärderar Vals hur modeller utför komplexa uppgifter i specifika branscher som juridik, finans och kodning.
"Vad vi gör är att titta på vad som är de verkliga effekterna av modellerna," sa Krishnan. "Kan de utföra arbete som producerar en produkt av samma kvalitet som en människa inom varje domän?"
Företaget mäter också misslyckande lägen, inte bara framgångar. Krishnan sa att Vals syftar till att analysera "om dessa modeller gick vilda i världen, vad de negativa konsekvenserna skulle vara" - en utvärderingsfilosofi som behandlar nedåtrisk som en mätbar produktion snarare än en eftertanke.
Från lag och finans till Genèvekonventioner och rekursiv självförbättring
Omfattningen av Vals utvärderingar fortsätter att expandera bortom sina professionella tjänster. Vid sidan av riktmärken för lag, ekonomi och kodning, sa Krishnan att företaget nu kör tester inom mental hälsa, cybersäkerhet och biosäkerhet, och till och med ett riktmärke för rekursiv självförbättring - ett ämne som diskuteras mer allmänt i AI-säkerhetskretsar än i kommersiella utvärderingssviter.
Mest slående är kanske dess arbete med lagen om väpnad konflikt, där Vals testar hur modeller förstår och tillämpar Genèvekonventionen. Bredden signalerar var efterfrågan kommer ifrån: inte bara laboratorier som tävlar mot topplistorna, utan företag och institutioner som behöver bevis på hur modeller beter sig på domäner med hög insats innan de distribueras.
Affärsmodellen: Betala för att göra testet
Företag betalar Vals för att utvärdera sina modeller – ett arrangemang som kan verka kontraintuitivt. Varför skulle ett företag betala för resultat som kan genera det? Krishnan jämför modellen med att en student betalar College Board för att ta SAT: en oberoende mätning, till och med en föga smickrande, hjälper ett företag att felsöka och förbättra över tiden.
Marknaden verkar reagera. Vals säger att dess intäkter för närvarande är åtta gånger högre än förra året, och att dess team har tredubblats sedan början av året och har vuxit från åtta personer till 25. Företaget verkar från ett tvåvåningskontor på San Franciscos Folsom Street – en före detta bryggeribyggnad som nu inrymmer flera nystartade företag.
Utvärderingar håller också på att bli beslutsfattande faktorer för företag som köper AI-modeller, enligt företaget, vilket ger riktmärken en roll som ligger närmare due diligence än marknadsföring.
En 25-årig grundare med säte i främre raden
Krishnan, 25, internerade på Palantir och arbetade som student vid Stanford för Microsoft och universitetets välkända artificiell intelligenslabb. Han säger att Vals föddes av att se utvärdering hamna bakom branschen som den var tänkt att mäta - ett gap som bara har ökat när nya modeller anländer snabbare än akademiska riktmärken kan utformas, valideras och publiceras.
Startupen ansluter sig nu till en liten men växande kohort av företag som försöker institutionalisera AI-utvärdering, ett utrymme som inkluderar akademiska insatser, leaderboard-projekt med öppen källkod och säkerhetsinstitut. Det som utmärker Vals är dess privata testmodell och dess fokus på betalda, branschspecifika utvärderingar snarare än offentliga rankningar.
Varför det är viktigt
AI-branschens trovärdighetsproblem med riktmärken är väldokumenterat: läckta testset, misstänkta topplistor och marknadsföringspåståenden som överträffar verkliga prestanda. Om köpare – särskilt företag och regeringar – börjar förlita sig på privata, uppgiftsbaserade utvärderingar som Vals, kan incitamenten för modellutvecklare flyttas från undervisning till test mot genuin förmåga.
Det är långt ifrån avgjort. Ett privat riktmärke ber fortfarande köpare att lita på domaren, och Vals kunder är samma företag som betygsätts. Men med en serie A på 40 miljoner dollar, åttafaldig intäktstillväxt och efterfrågan som sträcker sig från finansiering till biosäkerhet, är vadet att utvärdering av oberoende känsla håller på att bli infrastruktur – en tjänst som AI-ekonomin kommer att betala för oavsett om resultaten smickrar den eller inte.
Ligg före AI
Vem mäter mätarna? Följ verksamheten med AI-utvärdering och startups som omformar den på AI Buzz Wire, din källa för bristande AI-nyheter.
Läs de senaste AI-nyheterna →