معیارهای هوش مصنوعی تصمیم می‌گیرند که کدام مدل‌ها سرفصل اخبار باشند – و شرکت‌هایی که این مدل‌ها را می‌سازند یاد گرفته‌اند که چگونه آنها را شکست دهند. استارت‌آپی به نام Vals که در سال 2024 تأسیس شد، شرط می‌بندد که صنعت به داوری نیاز دارد که آزمایش‌هایش قابل بازی نباشد و سرمایه‌گذاران از این شرط‌بندی به شکلی بزرگ حمایت کردند: Vals در ماه گذشته، پس از یک دور اولیه به رهبری 8VC و بلومبرگ بتا، سری A 40 میلیون دلاری به رهبری آندریسن هوروویتز جمع‌آوری کرد.

رشد این شرکت در بحبوحه نگرانی فزاینده در مورد چگونگی اندازه گیری قابلیت های هوش مصنوعی و اینکه وقتی معیار تبدیل به یک ابزار بازاریابی می شود چه اتفاقی می افتد رخ می دهد. برای اطلاعات بیشتر در مورد تجارت هوش مصنوعی، [پوشش صنعت AI] (https://aibuzzwire.news) را دنبال کنید.

وقتی معیارها تبدیل به بازاریابی می شوند

بنچمارک‌سازی به یک استاندارد صنعتی برای اعتبارسنجی قابلیت‌های مدل‌های هوش مصنوعی تبدیل شده است - و زمانی که اعداد و ارقام در مسیر شرکت قرار می‌گیرد، برای برتری تبلیغاتی نسبت به رقبا. معیارهای خوب به معنای روابط عمومی خوب است.

به گفته رایان کریشنان، یکی از بنیانگذاران و مدیرعامل Vals، مشکل این است که بسیاری از معیارهای قدیمی برای نسل قبلی مدل‌ها ساخته شده‌اند و شرکت‌ها نحوه بهینه‌سازی را در برابر آن‌ها کشف کرده‌اند. هنگامی که مواد آزمایشی عمومی هستند، یک مدل می‌تواند به طور مؤثر برای قبولی در امتحان آموزش داده شود - عملی که صنعت به طور مختلف به عنوان آلودگی، تطبیق بیش از حد، یا تقلب آشکار توصیف کرده است.

کریشنان در مصاحبه‌ای با TechCrunch گفت: «ما شاهد آمدن یک سری مدل‌های جدید و بسیار توانا بودیم که به سرعت به بازار آمدند، و معیارهای آکادمیک [با این پیشرفت مرزی مطابقت نداشتند».

تست های خصوصی، وظایف دنیای واقعی

Vals از دو جنبه رویکرد متفاوتی دارد. اولاً، مواد آزمایشی خاص خود را به‌طور عمومی فاش نمی‌کند، که آموزش مدل‌های خود را در برابر امتحان برای یک شرکت سخت‌تر می‌کند. دوم، به جای اندازه‌گیری دانش انتزاعی – اینکه آیا یک مدل می‌تواند به سؤالات سبک آزمون نواری پاسخ دهد – ارزیابی می‌کند که مدل‌ها چگونه وظایف پیچیده‌ای را در صنایع خاص مانند قانون، امور مالی و کدنویسی انجام می‌دهند.

کریشنان گفت: "کاری که ما انجام می دهیم در واقع بررسی تاثیرات واقعی مدل ها است." "آیا آنها می توانند کاری انجام دهند که محصولی با کیفیتی مشابه انسان در هر حوزه ای تولید کند؟"

این شرکت همچنین حالت های شکست را اندازه گیری می کند، نه فقط موفقیت ها را. کریشنان گفت که Vals قصد دارد «اگر این مدل‌ها در جهان اجرا شوند، پیامدهای منفی آن چه خواهد بود» - یک فلسفه ارزیابی که ریسک نزولی را به‌عنوان یک خروجی قابل اندازه‌گیری تلقی می‌کند و نه یک فکر بعدی.

از قانون و امور مالی تا کنوانسیون های ژنو و خود-بهبودی بازگشتی

دامنه ارزیابی های Vals فراتر از ریشه های خدمات حرفه ای آن گسترش می یابد. کریشنان گفت که در کنار معیارهای قانون، امور مالی و کدنویسی، این شرکت اکنون آزمایش هایی را در زمینه سلامت روان، امنیت سایبری و امنیت زیستی و حتی معیاری برای بهبود خود بازگشتی انجام می دهد - موضوعی که بیشتر در محافل ایمنی هوش مصنوعی مورد بحث قرار می گیرد تا مجموعه های ارزیابی تجاری.

شاید جالب‌ترین کار آن در مورد قانون درگیری‌های مسلحانه باشد، جایی که والز در حال آزمایش نحوه درک و استفاده مدل‌ها از کنوانسیون ژنو است. وسعت سیگنال‌هایی است که تقاضا از کجا می‌آید: نه فقط آزمایشگاه‌هایی که برای رسیدن به رتبه‌های برتر رقابت می‌کنند، بلکه شرکت‌ها و مؤسساتی که نیاز به شواهدی از نحوه رفتار مدل‌ها در حوزه‌های پرمخاطره قبل از استقرار دارند.

مدل کسب و کار: برای شرکت در آزمون هزینه کنید

شرکت‌ها برای ارزیابی مدل‌هایشان به Vals می‌پردازند - ترتیبی که می‌تواند غیرمعمول به نظر برسد. چرا یک شرکت برای نتایجی که ممکن است باعث شرمساری آن شود، هزینه پرداخت می کند؟ کریشنان مدل را با دانشجویی مقایسه می‌کند که برای گرفتن آزمون SAT به هیئت کالج پول می‌دهد: یک اندازه‌گیری مستقل، حتی یک اندازه‌گیری نامطلوب، به شرکت کمک می‌کند عیب‌یابی کند و در طول زمان بهبود یابد.

به نظر می رسد بازار در حال پاسخگویی است. Vals می گوید درآمدش در حال حاضر هشت برابر سال گذشته است و تیمش از ابتدای سال سه برابر شده است و از هشت نفر به 25 نفر افزایش یافته است.

به گفته این شرکت، ارزیابی‌ها همچنین به عوامل تصمیم‌گیری برای شرکت‌هایی تبدیل می‌شوند که مدل‌های هوش مصنوعی را خریداری می‌کنند و به معیارها نقشی نزدیک‌تر به بررسی دقیق نسبت به بازاریابی می‌دهند.

یک بنیانگذار 25 ساله با صندلی در ردیف جلو

کریشنان، 25 ساله، در Palantir کارآموزی کرد و به عنوان دانشجوی کارشناسی در استنفورد، برای مایکروسافت و آزمایشگاه هوش مصنوعی معروف دانشگاه کار کرد. او می‌گوید که Vals از تماشای عقب افتادن ارزشیابی از صنعتی که قرار بود اندازه‌گیری کند متولد شد – شکافی که تنها با رسیدن مدل‌های جدید سریع‌تر از طراحی، تأیید و انتشار مدل‌های جدید بیشتر شده است.

این استارتاپ اکنون به گروه کوچک اما رو به رشدی از شرکت‌ها می‌پیوندد که تلاش می‌کنند ارزیابی هوش مصنوعی را نهادینه کنند، فضایی که شامل تلاش‌های آکادمیک، پروژه‌های رهبران منبع باز و موسسات ایمنی است. چیزی که Vals را متمایز می کند، مدل تست خصوصی و تمرکز آن بر ارزیابی های پولی و خاص صنعت به جای رتبه بندی عمومی است.

چرا مهم است

مشکل اعتبار صنعت هوش مصنوعی با معیارها به خوبی مستند شده است: مجموعه‌های آزمایشی لو رفته، جهش‌های مشکوک در تابلوی امتیازات و ادعاهای بازاریابی که از عملکرد دنیای واقعی پیشی می‌گیرند. اگر خریداران – به‌ویژه شرکت‌ها و دولت‌ها – شروع به تکیه بر ارزیابی‌های خصوصی و مبتنی بر وظیفه مانند Vals کنند، انگیزه‌های توسعه‌دهندگان مدل می‌تواند از آموزش به آزمایش به سمت قابلیت واقعی تغییر کند.

که تا حل شدن فاصله زیادی دارد. یک معیار خصوصی همچنان از خریداران می خواهد که به داور اعتماد کنند و مشتریان Vals همان شرکت هایی هستند که درجه بندی می شوند. اما با 40 میلیون دلار سری A، رشد درآمد 8 برابری و تقاضای تامین مالی تا امنیت زیستی، شرط این است که ارزیابی مستقل در حال تبدیل شدن به زیرساخت است - خدماتی که اقتصاد هوش مصنوعی برای اینکه آیا نتایج آن را خوشایند کند یا نه، پرداخت خواهد کرد.

از هوش مصنوعی جلوتر بمانید

چه کسی اندازه گیری ها را اندازه گیری می کند؟ کسب‌وکار ارزیابی هوش مصنوعی و استارت‌آپ‌هایی که آن را تغییر شکل می‌دهند را در [AI Buzz Wire] (https://aibuzzwire.news)، منبع خود برای [اخبار جدید هوش مصنوعی] (https://aibuzzwire.news/en) دنبال کنید.

آخرین اخبار هوش مصنوعی را بخوانید →