Patronus AI، استارتآپی که محیطهای دیجیتالی شبیهسازیشده را برای ارزیابی عوامل هوش مصنوعی مستقل میسازد، ۵۰ میلیون دلار در دور سری B بهعنوان افزایش تقاضا برای تست عامل قابل اعتماد جمعآوری کرده است. TechCrunch گزارش داد که این دور توسط Greenfield Partners با مشارکت Notable Capital، Lightspeed، Datadog و Samsung رهبری شد و مجموع بودجه شرکت را به 70 میلیون دلار رساند.
یک مشکل جدید: عواملی که میانبر می گیرند For more context on this story, see our ongoing AI news.
همانطور که عوامل هوش مصنوعی از پاسخ دادن به سوالات به اجرای مستقل وظایف پیچیده و چند مرحله ای تکامل می یابند، ارائه دهندگان مدل و استارتاپ هایی که چنین عواملی را می سازند، نیاز به اطمینان دارند که سیستم ها در طیف وسیعی از سناریوها به طور قابل اعتماد عمل خواهند کرد. آزمایشگاههای هوش مصنوعی اغلب از معیارها برای نشان دادن مهارت یک مدل استفاده میکنند، اما امتیاز بالا در یک معیار عامل محور ثابت نمیکند که یک هوش مصنوعی واقعاً میتواند کارهای دنیای واقعی را به درستی انجام دهد.
این شکاف جایی است که هوش مصنوعی Patronus تمرکز می کند. این شرکت مستقر در سانفرانسیسکو که در سال 2023 توسط محققین سابق هوش مصنوعی متا، Anand Kannappan و Rebecca Qian تأسیس شد، آنچه را «مدلهای دنیای دیجیتال» مینامد، کپیهایی از وبسایتها و سیستمهای داخلی میسازد که در آن عوامل پس از آموزش تحت آزمایش استرس قرار میگیرند. عوامل با استفاده از یادگیری تقویتی ارزیابی می شوند که به طور مکرر به تکمیل موفقیت آمیز کار پاداش می دهد و خطاها را مجازات می کند.
قرض گرفتن از وسایل نقلیه خودران
این شرکت رویکرد خود را با نحوه آموزش وایمو به ماشینهای خودران مقایسه میکند و ابتدا جهانهای مصنوعی ساخت تا وسایل نقلیه را در برابر خطرات نادری مانند آبوهوای سخت یا کودکی که دنبال توپ میدوید، آزمایش کند. تفاوت اصلی با عوامل هوش مصنوعی این است که آنها تمایل به استفاده از میانبرها دارند، به این معنی که حتی زمانی که به نظر می رسد موفق هستند، وظایف خود را به درستی انجام نمی دهند.
گلن سولومون، مدیر عامل شرکت نوتبل کپیتال، گفت: «پترونوس در شناسایی هکها و اطمینان از اینکه مدلها را پاسخگو میدانند، واقعاً خوب است. سولومون تقاضا برای محیط های شبیه سازی شده شرکت را تقریبا سیری ناپذیر توصیف کرد. تقریباً همه آزمایشگاههای مرزی هوش مصنوعی و بسیاری از استارتآپهای نوظهور اکنون مشتری هستند و درآمد Patronus در طول سال گذشته 15 برابر شده است.
گسترش فراتر از وظایف قابل تأیید
Patronus در حال حاضر جهان های دیجیتال شبیه سازی شده خود را برای مهندسی نرم افزار و امور مالی ارائه می دهد، دو حوزه ای که بررسی نتایج نسبتاً آسان است. اما این شرکت اینها را تنها شروع کار می داند. کاناپان گفت: «امروز ما روی مشکلاتی که قابل راستیآزمایی هستند، مشکلاتی که میتوانید فوراً آنها را بررسی و تأیید کنید، بسیار متمرکز شدهایم، اما تعداد زیادی نواحی وجود دارد که بسیار غیرقابل تأیید یا تأیید آنها بسیار دشوار است».
جاه طلبی ساختن محیط هایی است که به اندازه کافی قابل توجه برای آزمایش عوامل در افق های طولانی است. Kannappan گفت: «ما میخواهیم واقعاً بتوانیم محیطی را ایجاد کنیم که در آن شما بتوانید عاملی را که میتواند 10 ساعت یا 10 روز یا 10 هفته اجرا کند، کار کنید. فقط به این دلیل که فرآیندها قابل تأیید هستند به این معنی نیست که ساده هستند، و توانایی شناسایی یک عامل که در یک جریان کاری چند روزه شکست میخورد، برای ارزش پیشنهادی شرکت بسیار مهم است.
این بودجه همچنین زمانی دریافت میشود که صنعت گستردهتر هوش مصنوعی با نحوه اندازهگیری پیشرفت دست و پنجه نرم میکند. امتیازات بنچمارک تبدیل به یک ارز مورد بحث شده است و منتقدان استدلال می کنند که مدل ها را می توان برای تست های خاص بازی بدون بهبود واقعی در کارهای واقعی بهینه کرد. محیطهای شبیهسازیشده Patronus یک جایگزین را ارائه میدهند و عوامل آزمایشی را در سناریوهای باز ارائه میکنند که در آن تنها مدرک موفقیت، یک کار بهدرستی تکمیلشده است نه یک عدد در تابلوی امتیازات.
برای مشتریان سازمانی، این تمایز مهم است. عامل کد نویسی که معیاری را پاس می کند اما بی سر و صدا اشکالات را به یک پایگاه کد تولید وارد می کند، یا یک عامل مالی که ارقام را اشتباه گرد می کند، می تواند آسیب بسیار بیشتری نسبت به نمره آزمون پایین ایجاد کند. Patronus با شناسایی این خرابی ها در جعبه ماسه ای قبل از استقرار، ارزیابی را به عنوان پیش نیاز اعتماد، نه یک فکر بعدی، قرار می دهد.
یک رویکرد متمایز در یک میدان شلوغ
در مورد رقبا، Patronus معتقد است که در درجه اول با تیمهای ارزیابی داخلی که آزمایشگاههای هوش مصنوعی برای ارزیابی رفتار عامل ساختهاند، رقابت میکند. در حالی که شرکتهای دادههای انسانی مانند Mercor و Surge به سازندگان مدل در یادگیری تقویتی کمک میکنند، Patronus با ارزیابی نحوه رفتار عوامل بدون دخالت انسانی، بهطور خودکار عمل میکند و تشخیص خرابیهایی را که در غیر این صورت مستلزم بررسی دستی پرهزینه است، بهطور خودکار انجام میدهد.
این دور به سرمایه گذاران اطمینان می دهد که ارزیابی عامل به لایه ای اساسی از پشته هوش مصنوعی تبدیل خواهد شد. از آنجایی که نمایندگان کار مستقلتری را انجام میدهند، از رزرو سفر گرفته تا انجام تجزیه و تحلیل مالی، استارتآپهایی که میتوانند قبل از استقرار آنها قابل اعتماد بودن آن سیستمها را ثابت کنند، خود را به عنوان دروازهبانان ضروری عصر هوش مصنوعی معرفی میکنند.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →


