Benchmark-urile AI decid care modele fac titluri – iar companiile care construiesc acele modele au învățat cum să le învingă. Un startup numit Vals, format în 2024, pariază că industria are nevoie de un arbitru ale cărui teste nu pot fi jucate, iar investitorii tocmai au susținut acest pariu în mare măsură: Vals a strâns o serie A de 40 de milioane de dolari condusă de Andreessen Horowitz luna trecută, în urma unei runde de start conduse de 8VC și Bloomberg Beta.
Creșterea companiei vine pe fondul neliniștii tot mai mari cu privire la modul în care sunt măsurate capabilitățile AI și ce se întâmplă atunci când criteriul devine un instrument de marketing. Pentru mai multe despre afacerile AI, urmăriți Acoperirea industriei AI.
Când benchmark-urile devin marketing
Benchmarking-ul a devenit norma din industrie pentru validarea capabilităților modelelor de IA și, atunci când cifrele se schimbă în direcția unei companii, pentru promovarea superiorității față de rivali. Punctele de referință bune înseamnă relații publice bune.
Problema, potrivit cofondatorului și CEO-ului Vals, Rayan Krishnan, este că multe repere moștenite au fost construite pentru o generație anterioară de modele, iar companiile și-au dat seama cum să le optimizeze. Când materialele de testare sunt publice, un model poate fi instruit în mod eficient pentru a promova examenul - o practică pe care industria a descris-o în mod diferit ca contaminare, supraadaptare sau înșelăciune.
„Am văzut că o grămadă de modele noi, foarte capabile, ies pe piață rapid, iar reperele academice nu țineau pasul cu acel avans de frontieră”, a spus Krishnan într-un interviu pentru TechCrunch.
Teste private, sarcini din lumea reală
Vals adoptă o abordare diferită pe două fronturi. În primul rând, nu își dezvăluie public materialele de testare specifice, ceea ce face mult mai dificil pentru o companie să-și antreneze modelele împotriva examenului. În al doilea rând, în loc să măsoare cunoștințele abstracte - dacă un model poate răspunde la întrebări de tip bar-examen - Vals evaluează modul în care modelele îndeplinesc sarcini complexe în industrii specifice, cum ar fi dreptul, finanțele și codificarea.
„Ceea ce facem este să ne uităm de fapt la impactul real al modelelor”, a spus Krishnan. „Pot ei să facă o muncă care să producă un produs de aceeași calitate ca un om în fiecare domeniu?”
Compania măsoară și modurile de eșec, nu doar succesele. Krishnan a spus că Vals își propune să analizeze „dacă aceste modele s-au dezlănțuit în lume, care ar fi implicațiile negative” – o filozofie de evaluare care tratează riscul de dezavantaj ca un rezultat măsurabil, mai degrabă decât o gândire ulterioară.
De la drept și finanțe la convențiile de la Geneva și auto-îmbunătățirea recursive
Sfera evaluărilor Vals continuă să se extindă dincolo de rădăcinile sale de servicii profesionale. Alături de standardele de drept, finanțe și codare, Krishnan a spus că compania rulează acum teste în sănătatea mintală, securitatea cibernetică și biosecuritatea și chiar și un etalon pentru auto-îmbunătățirea recursivă - un subiect mai des discutat în cercurile de siguranță AI decât în suitele de evaluare comerciale.
Poate că cea mai frapantă este munca sa privind dreptul conflictelor armate, unde Vals testează modul în care modelele înțeleg și aplică Convenția de la Geneva. Amploarea semnalează de unde vine cererea: nu doar laboratoarele care se concurează către clasamentele de top, ci și întreprinderile și instituțiile care au nevoie de dovezi despre modul în care modelele se comportă în domeniile cu mize mari înainte de a le implementa.
Modelul de afaceri: plătiți pentru a susține testul
Companiile îl plătesc pe Vals pentru a-și evalua modelele - un aranjament care poate părea contraintuitiv. De ce ar plăti o companie pentru rezultate care ar putea să o facă de rușine? Krishnan compară modelul cu un student care plătește College Board pentru a lua SAT: o măsurare independentă, chiar și una nemăgulitoare, ajută o companie să depaneze și să se îmbunătățească în timp.
Piața pare să răspundă. Vals spune că veniturile sale sunt în prezent de opt ori mai mari decât anul trecut, iar echipa sa s-a triplat de la începutul anului, crescând de la opt persoane la 25. Compania operează dintr-un birou cu două etaje pe Folsom Street din San Francisco - o fostă clădire de bere care acum găzduiește mai multe startup-uri.
Evaluările devin, de asemenea, factori de decizie pentru întreprinderile care cumpără modele AI, potrivit companiei, acordând benchmark-urilor un rol mai apropiat de due diligence decât de marketing.
Un fondator de 25 de ani, cu un loc în primul rând
Krishnan, 25 de ani, a fost internat la Palantir și, ca student la Stanford, a lucrat pentru Microsoft și pentru cunoscutul laborator de inteligență artificială al universității. El spune că Vals s-a născut din observarea faptului că evaluarea rămâne în urmă industriei pe care trebuia să o măsoare – un decalaj care s-a mărit doar pe măsură ce noile modele ajung mai repede decât pot fi proiectate, validate și publicate reperele academice.
Startup-ul se alătură acum unei cohorte mici, dar în creștere, de companii care încearcă să instituționalizeze evaluarea AI, un spațiu care include eforturi academice, proiecte de clasament open-source și institute de siguranță. Ceea ce distinge Vals este modelul său de test privat și concentrarea sa pe evaluări plătite, specifice industriei, mai degrabă decât pe clasamentele publice.
De ce contează
Problema de credibilitate a industriei AI cu benchmark-urile este bine documentată: seturi de teste scurse, salturi suspecte în clasament și afirmații de marketing care depășesc performanța din lumea reală. Dacă cumpărătorii – în special întreprinderile și guvernele – încep să se bazeze pe evaluări private, bazate pe sarcini, cum ar fi Vals, stimulentele pentru dezvoltatorii de modele s-ar putea muta de la predare la testare la capacitatea reală.
Este departe de a se stabili. Un benchmark privat încă le cere cumpărătorilor să aibă încredere în arbitru, iar clienții lui Vals sunt aceleași companii care sunt evaluate. Dar cu o Seria A de 40 de milioane de dolari, o creștere de opt ori a veniturilor și o cerere care cuprinde finanțare până la biosecuritate, pariul este că evaluarea independentă devine infrastructură - un serviciu pe care economia AI îl va plăti, indiferent dacă rezultatele îl flatează sau nu.
Rămâi înaintea AI
Cine măsoară măsurătorile? Urmărește activitatea evaluării AI și startup-urile care o remodelează la AI Buzz Wire, sursa ta pentru știri de ultimă oră.
Citiți cele mai recente știri despre AI →