معیارهای هوش مصنوعی تصمیم میگیرند که کدام مدلها سرفصل اخبار باشند – و شرکتهایی که این مدلها را میسازند یاد گرفتهاند که چگونه آنها را شکست دهند. استارتآپی به نام Vals که در سال 2024 تأسیس شد، شرط میبندد که صنعت به داوری نیاز دارد که آزمایشهایش قابل بازی نباشد و سرمایهگذاران از این شرطبندی به شکلی بزرگ حمایت کردند: Vals در ماه گذشته، پس از یک دور اولیه به رهبری 8VC و بلومبرگ بتا، سری A 40 میلیون دلاری به رهبری آندریسن هوروویتز جمعآوری کرد.
رشد این شرکت در بحبوحه نگرانی فزاینده در مورد چگونگی اندازه گیری قابلیت های هوش مصنوعی و اینکه وقتی معیار تبدیل به یک ابزار بازاریابی می شود چه اتفاقی می افتد رخ می دهد. برای اطلاعات بیشتر در مورد تجارت هوش مصنوعی، [پوشش صنعت AI] (https://aibuzzwire.news) را دنبال کنید.
وقتی معیارها تبدیل به بازاریابی می شوند
بنچمارکسازی به یک استاندارد صنعتی برای اعتبارسنجی قابلیتهای مدلهای هوش مصنوعی تبدیل شده است - و زمانی که اعداد و ارقام در مسیر شرکت قرار میگیرد، برای برتری تبلیغاتی نسبت به رقبا. معیارهای خوب به معنای روابط عمومی خوب است.
به گفته رایان کریشنان، یکی از بنیانگذاران و مدیرعامل Vals، مشکل این است که بسیاری از معیارهای قدیمی برای نسل قبلی مدلها ساخته شدهاند و شرکتها نحوه بهینهسازی را در برابر آنها کشف کردهاند. هنگامی که مواد آزمایشی عمومی هستند، یک مدل میتواند به طور مؤثر برای قبولی در امتحان آموزش داده شود - عملی که صنعت به طور مختلف به عنوان آلودگی، تطبیق بیش از حد، یا تقلب آشکار توصیف کرده است.
کریشنان در مصاحبهای با TechCrunch گفت: «ما شاهد آمدن یک سری مدلهای جدید و بسیار توانا بودیم که به سرعت به بازار آمدند، و معیارهای آکادمیک [با این پیشرفت مرزی مطابقت نداشتند».
تست های خصوصی، وظایف دنیای واقعی
Vals از دو جنبه رویکرد متفاوتی دارد. اولاً، مواد آزمایشی خاص خود را بهطور عمومی فاش نمیکند، که آموزش مدلهای خود را در برابر امتحان برای یک شرکت سختتر میکند. دوم، به جای اندازهگیری دانش انتزاعی – اینکه آیا یک مدل میتواند به سؤالات سبک آزمون نواری پاسخ دهد – ارزیابی میکند که مدلها چگونه وظایف پیچیدهای را در صنایع خاص مانند قانون، امور مالی و کدنویسی انجام میدهند.
کریشنان گفت: "کاری که ما انجام می دهیم در واقع بررسی تاثیرات واقعی مدل ها است." "آیا آنها می توانند کاری انجام دهند که محصولی با کیفیتی مشابه انسان در هر حوزه ای تولید کند؟"
این شرکت همچنین حالت های شکست را اندازه گیری می کند، نه فقط موفقیت ها را. کریشنان گفت که Vals قصد دارد «اگر این مدلها در جهان اجرا شوند، پیامدهای منفی آن چه خواهد بود» - یک فلسفه ارزیابی که ریسک نزولی را بهعنوان یک خروجی قابل اندازهگیری تلقی میکند و نه یک فکر بعدی.
از قانون و امور مالی تا کنوانسیون های ژنو و خود-بهبودی بازگشتی
دامنه ارزیابی های Vals فراتر از ریشه های خدمات حرفه ای آن گسترش می یابد. کریشنان گفت که در کنار معیارهای قانون، امور مالی و کدنویسی، این شرکت اکنون آزمایش هایی را در زمینه سلامت روان، امنیت سایبری و امنیت زیستی و حتی معیاری برای بهبود خود بازگشتی انجام می دهد - موضوعی که بیشتر در محافل ایمنی هوش مصنوعی مورد بحث قرار می گیرد تا مجموعه های ارزیابی تجاری.
شاید جالبترین کار آن در مورد قانون درگیریهای مسلحانه باشد، جایی که والز در حال آزمایش نحوه درک و استفاده مدلها از کنوانسیون ژنو است. وسعت سیگنالهایی است که تقاضا از کجا میآید: نه فقط آزمایشگاههایی که برای رسیدن به رتبههای برتر رقابت میکنند، بلکه شرکتها و مؤسساتی که نیاز به شواهدی از نحوه رفتار مدلها در حوزههای پرمخاطره قبل از استقرار دارند.
مدل کسب و کار: برای شرکت در آزمون هزینه کنید
شرکتها برای ارزیابی مدلهایشان به Vals میپردازند - ترتیبی که میتواند غیرمعمول به نظر برسد. چرا یک شرکت برای نتایجی که ممکن است باعث شرمساری آن شود، هزینه پرداخت می کند؟ کریشنان مدل را با دانشجویی مقایسه میکند که برای گرفتن آزمون SAT به هیئت کالج پول میدهد: یک اندازهگیری مستقل، حتی یک اندازهگیری نامطلوب، به شرکت کمک میکند عیبیابی کند و در طول زمان بهبود یابد.
به نظر می رسد بازار در حال پاسخگویی است. Vals می گوید درآمدش در حال حاضر هشت برابر سال گذشته است و تیمش از ابتدای سال سه برابر شده است و از هشت نفر به 25 نفر افزایش یافته است.
به گفته این شرکت، ارزیابیها همچنین به عوامل تصمیمگیری برای شرکتهایی تبدیل میشوند که مدلهای هوش مصنوعی را خریداری میکنند و به معیارها نقشی نزدیکتر به بررسی دقیق نسبت به بازاریابی میدهند.
یک بنیانگذار 25 ساله با صندلی در ردیف جلو
کریشنان، 25 ساله، در Palantir کارآموزی کرد و به عنوان دانشجوی کارشناسی در استنفورد، برای مایکروسافت و آزمایشگاه هوش مصنوعی معروف دانشگاه کار کرد. او میگوید که Vals از تماشای عقب افتادن ارزشیابی از صنعتی که قرار بود اندازهگیری کند متولد شد – شکافی که تنها با رسیدن مدلهای جدید سریعتر از طراحی، تأیید و انتشار مدلهای جدید بیشتر شده است.
این استارتاپ اکنون به گروه کوچک اما رو به رشدی از شرکتها میپیوندد که تلاش میکنند ارزیابی هوش مصنوعی را نهادینه کنند، فضایی که شامل تلاشهای آکادمیک، پروژههای رهبران منبع باز و موسسات ایمنی است. چیزی که Vals را متمایز می کند، مدل تست خصوصی و تمرکز آن بر ارزیابی های پولی و خاص صنعت به جای رتبه بندی عمومی است.
چرا مهم است
مشکل اعتبار صنعت هوش مصنوعی با معیارها به خوبی مستند شده است: مجموعههای آزمایشی لو رفته، جهشهای مشکوک در تابلوی امتیازات و ادعاهای بازاریابی که از عملکرد دنیای واقعی پیشی میگیرند. اگر خریداران – بهویژه شرکتها و دولتها – شروع به تکیه بر ارزیابیهای خصوصی و مبتنی بر وظیفه مانند Vals کنند، انگیزههای توسعهدهندگان مدل میتواند از آموزش به آزمایش به سمت قابلیت واقعی تغییر کند.
که تا حل شدن فاصله زیادی دارد. یک معیار خصوصی همچنان از خریداران می خواهد که به داور اعتماد کنند و مشتریان Vals همان شرکت هایی هستند که درجه بندی می شوند. اما با 40 میلیون دلار سری A، رشد درآمد 8 برابری و تقاضای تامین مالی تا امنیت زیستی، شرط این است که ارزیابی مستقل در حال تبدیل شدن به زیرساخت است - خدماتی که اقتصاد هوش مصنوعی برای اینکه آیا نتایج آن را خوشایند کند یا نه، پرداخت خواهد کرد.
از هوش مصنوعی جلوتر بمانید
چه کسی اندازه گیری ها را اندازه گیری می کند؟ کسبوکار ارزیابی هوش مصنوعی و استارتآپهایی که آن را تغییر شکل میدهند را در [AI Buzz Wire] (https://aibuzzwire.news)، منبع خود برای [اخبار جدید هوش مصنوعی] (https://aibuzzwire.news/en) دنبال کنید.
آخرین اخبار هوش مصنوعی را بخوانید →