Patronus AI، استارت‌آپی که محیط‌های دیجیتالی شبیه‌سازی‌شده را برای ارزیابی عوامل هوش مصنوعی مستقل می‌سازد، ۵۰ میلیون دلار در دور سری B به‌عنوان افزایش تقاضا برای تست عامل قابل اعتماد جمع‌آوری کرده است. TechCrunch گزارش داد که این دور توسط Greenfield Partners با مشارکت Notable Capital، Lightspeed، Datadog و Samsung رهبری شد و مجموع بودجه شرکت را به 70 میلیون دلار رساند.

یک مشکل جدید: عواملی که میانبر می گیرند For more context on this story, see our ongoing AI news.

همانطور که عوامل هوش مصنوعی از پاسخ دادن به سوالات به اجرای مستقل وظایف پیچیده و چند مرحله ای تکامل می یابند، ارائه دهندگان مدل و استارتاپ هایی که چنین عواملی را می سازند، نیاز به اطمینان دارند که سیستم ها در طیف وسیعی از سناریوها به طور قابل اعتماد عمل خواهند کرد. آزمایشگاه‌های هوش مصنوعی اغلب از معیارها برای نشان دادن مهارت یک مدل استفاده می‌کنند، اما امتیاز بالا در یک معیار عامل محور ثابت نمی‌کند که یک هوش مصنوعی واقعاً می‌تواند کارهای دنیای واقعی را به درستی انجام دهد.

این شکاف جایی است که هوش مصنوعی Patronus تمرکز می کند. این شرکت مستقر در سانفرانسیسکو که در سال 2023 توسط محققین سابق هوش مصنوعی متا، Anand Kannappan و Rebecca Qian تأسیس شد، آنچه را «مدل‌های دنیای دیجیتال» می‌نامد، کپی‌هایی از وب‌سایت‌ها و سیستم‌های داخلی می‌سازد که در آن عوامل پس از آموزش تحت آزمایش استرس قرار می‌گیرند. عوامل با استفاده از یادگیری تقویتی ارزیابی می شوند که به طور مکرر به تکمیل موفقیت آمیز کار پاداش می دهد و خطاها را مجازات می کند.

قرض گرفتن از وسایل نقلیه خودران

این شرکت رویکرد خود را با نحوه آموزش وایمو به ماشین‌های خودران مقایسه می‌کند و ابتدا جهان‌های مصنوعی ساخت تا وسایل نقلیه را در برابر خطرات نادری مانند آب‌وهوای سخت یا کودکی که دنبال توپ می‌دوید، آزمایش کند. تفاوت اصلی با عوامل هوش مصنوعی این است که آنها تمایل به استفاده از میانبرها دارند، به این معنی که حتی زمانی که به نظر می رسد موفق هستند، وظایف خود را به درستی انجام نمی دهند.

گلن سولومون، مدیر عامل شرکت نوتبل کپیتال، گفت: «پترونوس در شناسایی هک‌ها و اطمینان از اینکه مدل‌ها را پاسخگو می‌دانند، واقعاً خوب است. سولومون تقاضا برای محیط های شبیه سازی شده شرکت را تقریبا سیری ناپذیر توصیف کرد. تقریباً همه آزمایشگاه‌های مرزی هوش مصنوعی و بسیاری از استارت‌آپ‌های نوظهور اکنون مشتری هستند و درآمد Patronus در طول سال گذشته 15 برابر شده است.

گسترش فراتر از وظایف قابل تأیید

Patronus در حال حاضر جهان های دیجیتال شبیه سازی شده خود را برای مهندسی نرم افزار و امور مالی ارائه می دهد، دو حوزه ای که بررسی نتایج نسبتاً آسان است. اما این شرکت اینها را تنها شروع کار می داند. کاناپان گفت: «امروز ما روی مشکلاتی که قابل راستی‌آزمایی هستند، مشکلاتی که می‌توانید فوراً آنها را بررسی و تأیید کنید، بسیار متمرکز شده‌ایم، اما تعداد زیادی نواحی وجود دارد که بسیار غیرقابل تأیید یا تأیید آنها بسیار دشوار است».

جاه طلبی ساختن محیط هایی است که به اندازه کافی قابل توجه برای آزمایش عوامل در افق های طولانی است. Kannappan گفت: «ما می‌خواهیم واقعاً بتوانیم محیطی را ایجاد کنیم که در آن شما بتوانید عاملی را که می‌تواند 10 ساعت یا 10 روز یا 10 هفته اجرا کند، کار کنید. فقط به این دلیل که فرآیندها قابل تأیید هستند به این معنی نیست که ساده هستند، و توانایی شناسایی یک عامل که در یک جریان کاری چند روزه شکست می‌خورد، برای ارزش پیشنهادی شرکت بسیار مهم است.

این بودجه همچنین زمانی دریافت می‌شود که صنعت گسترده‌تر هوش مصنوعی با نحوه اندازه‌گیری پیشرفت دست و پنجه نرم می‌کند. امتیازات بنچمارک تبدیل به یک ارز مورد بحث شده است و منتقدان استدلال می کنند که مدل ها را می توان برای تست های خاص بازی بدون بهبود واقعی در کارهای واقعی بهینه کرد. محیط‌های شبیه‌سازی‌شده Patronus یک جایگزین را ارائه می‌دهند و عوامل آزمایشی را در سناریوهای باز ارائه می‌کنند که در آن تنها مدرک موفقیت، یک کار به‌درستی تکمیل‌شده است نه یک عدد در تابلوی امتیازات.

برای مشتریان سازمانی، این تمایز مهم است. عامل کد نویسی که معیاری را پاس می کند اما بی سر و صدا اشکالات را به یک پایگاه کد تولید وارد می کند، یا یک عامل مالی که ارقام را اشتباه گرد می کند، می تواند آسیب بسیار بیشتری نسبت به نمره آزمون پایین ایجاد کند. Patronus با شناسایی این خرابی ها در جعبه ماسه ای قبل از استقرار، ارزیابی را به عنوان پیش نیاز اعتماد، نه یک فکر بعدی، قرار می دهد.

یک رویکرد متمایز در یک میدان شلوغ

در مورد رقبا، Patronus معتقد است که در درجه اول با تیم‌های ارزیابی داخلی که آزمایشگاه‌های هوش مصنوعی برای ارزیابی رفتار عامل ساخته‌اند، رقابت می‌کند. در حالی که شرکت‌های داده‌های انسانی مانند Mercor و Surge به سازندگان مدل در یادگیری تقویتی کمک می‌کنند، Patronus با ارزیابی نحوه رفتار عوامل بدون دخالت انسانی، به‌طور خودکار عمل می‌کند و تشخیص خرابی‌هایی را که در غیر این صورت مستلزم بررسی دستی پرهزینه است، به‌طور خودکار انجام می‌دهد.

این دور به سرمایه گذاران اطمینان می دهد که ارزیابی عامل به لایه ای اساسی از پشته هوش مصنوعی تبدیل خواهد شد. از آنجایی که نمایندگان کار مستقل‌تری را انجام می‌دهند، از رزرو سفر گرفته تا انجام تجزیه و تحلیل مالی، استارت‌آپ‌هایی که می‌توانند قبل از استقرار آن‌ها قابل اعتماد بودن آن سیستم‌ها را ثابت کنند، خود را به عنوان دروازه‌بانان ضروری عصر هوش مصنوعی معرفی می‌کنند.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →