Les benchmarks de l’IA déterminent quels modèles font la une des journaux – et les entreprises qui construisent ces modèles ont appris à les battre. Une startup appelée Vals, créée en 2024, parie que l'industrie a besoin d'un arbitre dont les tests ne peuvent pas être joués, et les investisseurs viennent de soutenir ce pari de manière importante : Vals a levé une série A de 40 millions de dollars dirigée par Andreessen Horowitz le mois dernier, à la suite d'un tour de table mené par 8VC et Bloomberg Beta.
L'essor de l'entreprise s'inscrit dans un contexte de malaise croissant quant à la manière dont les capacités de l'IA sont mesurées et à ce qui se passe lorsque l'étalon devient un outil marketing. Pour en savoir plus sur les activités de l'IA, suivez Couverture de l'industrie de l'IA.
Quand les benchmarks deviennent marketing
L'analyse comparative est devenue la norme du secteur pour valider les capacités des modèles d'IA et, lorsque les chiffres penchent en faveur d'une entreprise, pour assurer sa supériorité publicitaire sur ses concurrents. De bons repères signifient de bonnes relations publiques.
Le problème, selon Rayan Krishnan, co-fondateur et PDG de Vals, est que de nombreux benchmarks hérités ont été construits pour une génération précédente de modèles, et les entreprises ont trouvé comment les optimiser. Lorsque le matériel de test est public, un modèle peut effectivement être formé pour réussir l'examen – une pratique que l'industrie a décrite de diverses manières comme une contamination, un surapprentissage ou une tricherie pure et simple.
"Nous avons vu un certain nombre de nouveaux modèles très performants arriver rapidement sur le marché, et les références académiques ne suivaient pas cette avancée", a déclaré Krishnan dans une interview avec TechCrunch.
Tests privés, tâches du monde réel
Vals adopte une approche différente sur deux fronts. Premièrement, elle ne divulgue pas publiquement ses supports de test spécifiques, ce qui rend beaucoup plus difficile pour une entreprise de former ses modèles à l'examen. Deuxièmement, au lieu de mesurer les connaissances abstraites (si un modèle peut répondre à des questions de type examen du barreau), Vals évalue la manière dont les modèles effectuent des tâches complexes dans des secteurs spécifiques comme le droit, la finance et le codage.
"Ce que nous faisons, c'est examiner quels sont les impacts réels des modèles", a déclaré Krishnan. « Peuvent-ils effectuer un travail qui produit un produit de la même qualité qu'un être humain dans tous les domaines ? »
L’entreprise mesure également les modes d’échec, et pas seulement les succès. Krishnan a déclaré que Vals vise à analyser "si ces modèles se déchaînaient dans le monde, quelles en seraient les implications négatives" - une philosophie d'évaluation qui traite le risque de baisse comme un résultat mesurable plutôt que comme une réflexion après coup.
Du droit et de la finance aux Conventions de Genève et au développement personnel récursif
La portée des évaluations de Vals ne cesse de s'étendre au-delà de ses racines de services professionnels. Outre les références juridiques, financières et de codage, Krishnan a déclaré que la société exécute désormais des tests dans les domaines de la santé mentale, de la cybersécurité et de la biosécurité, et même une référence sur l'auto-amélioration récursive – un sujet plus couramment abordé dans les cercles de sécurité de l'IA que dans les suites d'évaluation commerciales.
Le plus frappant est peut-être son travail sur le droit des conflits armés, dans lequel Vals teste la manière dont les modèles comprennent et appliquent la Convention de Genève. L'ampleur indique d'où vient la demande : non seulement les laboratoires qui se précipitent vers les meilleurs classements, mais aussi les entreprises et les institutions qui ont besoin de preuves du comportement des modèles dans des domaines à enjeux élevés avant de les déployer.
Le modèle économique : payer pour passer le test
Les entreprises paient Vals pour évaluer leurs modèles – un arrangement qui peut sembler contre-intuitif. Pourquoi une entreprise paierait-elle pour des résultats qui pourraient la gêner ? Krishnan compare le modèle à un étudiant payant le College Board pour passer le SAT : une mesure indépendante, même peu flatteuse, aide une entreprise à résoudre les problèmes et à s'améliorer au fil du temps.
Le marché semble réagir. Vals affirme que son chiffre d'affaires est actuellement huit fois supérieur à celui de l'année dernière et que son équipe a triplé depuis le début de l'année, passant de huit personnes à 25. La société opère à partir d'un bureau de deux étages sur Folsom Street à San Francisco, un ancien bâtiment de brasserie qui abrite désormais plusieurs startups.
Selon l'entreprise, les évaluations deviennent également des facteurs décisionnels pour les entreprises qui recherchent des modèles d'IA, ce qui confère aux références un rôle plus proche de la diligence raisonnable que du marketing.
Un fondateur de 25 ans aux premières loges
Krishnan, 25 ans, a effectué un stage à Palantir et, en tant qu'étudiant de premier cycle à Stanford, a travaillé pour Microsoft et le célèbre laboratoire d'intelligence artificielle de l'université. Il dit que Vals est né du fait que l’évaluation est à la traîne par rapport à l’industrie qu’elle était censée mesurer – un écart qui n’a fait que se creuser à mesure que de nouveaux modèles arrivent plus rapidement que les références académiques ne peuvent être conçues, validées et publiées.
La startup rejoint désormais une cohorte restreinte mais croissante d'entreprises qui tentent d'institutionnaliser l'évaluation de l'IA, un espace qui comprend des efforts universitaires, des projets de classement open source et des instituts de sécurité. Ce qui distingue Vals, c'est son modèle de tests privés et l'accent mis sur des évaluations payantes spécifiques à un secteur plutôt que sur des classements publics.
Pourquoi c'est important
Le problème de crédibilité de l'industrie de l'IA avec les benchmarks est bien documenté : fuites d'ensembles de tests, sauts suspects dans les classements et affirmations marketing qui dépassent les performances du monde réel. Si les acheteurs – en particulier les entreprises et les gouvernements – commencent à s'appuyer sur des évaluations privées basées sur des tâches comme celle de Vals, les incitations pour les développeurs de modèles pourraient passer de l'enseignement au test vers une véritable capacité.
C’est loin d’être réglé. Un benchmark privé demande toujours aux acheteurs de faire confiance à l'arbitre, et les clients de Vals sont les mêmes entreprises qui sont notées. Mais avec une série A de 40 millions de dollars, une croissance des revenus multipliée par huit et une demande allant du financement à la biosécurité, le pari est que l’évaluation indépendante devient une infrastructure – un service pour lequel l’économie de l’IA paiera, que les résultats la flattent ou non.
Gardez une longueur d'avance sur l'IA
Qui mesure les mesureurs ? Suivez l'évolution de l'évaluation de l'IA et les startups qui la remodèlent sur AI Buzz Wire, votre source pour les dernières actualités sur l'IA.
Lire les dernières nouvelles sur l'IA →