Patronus AI, một công ty khởi nghiệp xây dựng môi trường kỹ thuật số mô phỏng để đánh giá các tác nhân AI tự trị, đã huy động được 50 triệu USD trong vòng Series B khi nhu cầu thử nghiệm tác nhân đáng tin cậy tăng cao. Vòng này được dẫn dắt bởi Greenfield Partners với sự tham gia của Notable Capital, Lightspeed, Datadog và Samsung, TechCrunch đưa tin, nâng tổng số vốn tài trợ của công ty lên 70 triệu USD.

Một vấn đề mới: Đại lý đi đường tắt For more context on this story, see our ongoing AI news.

Khi các tác nhân AI phát triển từ việc trả lời các câu hỏi sang tự động thực hiện các nhiệm vụ phức tạp, gồm nhiều bước, các nhà cung cấp mô hình và các công ty khởi nghiệp xây dựng các tác nhân đó cần được đảm bảo rằng hệ thống sẽ hoạt động đáng tin cậy trong nhiều tình huống khác nhau. Các phòng thí nghiệm AI thường sử dụng điểm chuẩn để thể hiện năng lực của mô hình, nhưng điểm cao trong điểm chuẩn định hướng tác nhân không chứng minh rằng AI thực sự có thể hoàn thành công việc trong thế giới thực một cách chính xác.

Khoảng trống đó là nơi Patronus AI tập trung. Được thành lập vào năm 2023 bởi các cựu nhà nghiên cứu Meta AI Anand Kannappan và Rebecca Qian, công ty có trụ sở tại San Francisco xây dựng cái mà họ gọi là “mô hình thế giới kỹ thuật số”, bản sao của các trang web và hệ thống nội bộ trong đó các nhân viên được kiểm tra căng thẳng sau khi đào tạo. Các tác nhân được đánh giá bằng cách sử dụng phương pháp học tăng cường, trong đó lặp đi lặp lại phần thưởng cho việc hoàn thành nhiệm vụ thành công và phạt các lỗi.

Vay Xe Tự Hành

Công ty so sánh cách tiếp cận của mình với cách Waymo đào tạo ô tô tự lái, lần đầu tiên xây dựng thế giới tổng hợp để thử nghiệm phương tiện chống lại các mối nguy hiểm hiếm gặp như thời tiết khắc nghiệt hoặc một đứa trẻ chạy theo quả bóng. Điểm khác biệt chính với các tác nhân AI là chúng có xu hướng đi đường tắt, nghĩa là chúng không thể hoàn thành nhiệm vụ một cách chính xác ngay cả khi chúng có vẻ thành công.

Glenn Solomon, giám đốc điều hành tại Notable Capital, cho biết: “Patronus thực sự giỏi trong việc phát hiện các vụ hack và đảm bảo rằng họ buộc các mô hình phải chịu trách nhiệm”. Solomon mô tả nhu cầu về môi trường mô phỏng của công ty là gần như không thể đáp ứng được. Hầu như mọi phòng thí nghiệm AI hàng đầu và nhiều công ty khởi nghiệp mới nổi hiện đều là khách hàng và doanh thu của Patronus đã tăng gấp 15 lần trong năm qua.

Mở rộng ra ngoài các nhiệm vụ có thể xác minh được

Patronus hiện cung cấp thế giới kỹ thuật số mô phỏng cho công nghệ phần mềm và tài chính, hai lĩnh vực mà kết quả tương đối dễ xác minh. Nhưng công ty coi đây chỉ là sự khởi đầu. Kannappan nói: “Ngày nay, chúng tôi rất tập trung vào những vấn đề có thể kiểm chứng được, những vấn đề mà bạn có thể kiểm tra và xác minh ngay lập tức, nhưng còn rất nhiều lĩnh vực khác rất không thể kiểm chứng hoặc rất khó xác minh”.

Tham vọng là xây dựng các môi trường đủ lớn để thử nghiệm các tác nhân trong thời gian dài. Kannappan nói: “Chúng tôi muốn có thể thực sự tạo ra một môi trường trong đó bạn có thể vận hành một đại lý có thể hoạt động trong 10 giờ, 10 ngày hoặc 10 tuần”. Chỉ vì các quy trình có thể kiểm chứng được không có nghĩa là chúng đơn giản và khả năng phát hiện một nhân viên bị lỗi trong quá trình thực hiện quy trình làm việc kéo dài nhiều ngày là trọng tâm trong đề xuất giá trị của công ty.

Khoản tài trợ cũng đến khi ngành công nghiệp AI rộng lớn hơn đang vật lộn với cách đo lường tiến độ. Điểm chuẩn đã trở thành một vấn đề gây tranh cãi, với các nhà phê bình cho rằng các mô hình có thể được tối ưu hóa để chơi các bài kiểm tra cụ thể mà không thực sự cải thiện ở các nhiệm vụ thực tế. Môi trường mô phỏng của Patronus cung cấp một tác nhân thử nghiệm thay thế trong các tình huống mở, trong đó bằng chứng thành công duy nhất là công việc được hoàn thành chính xác chứ không phải là một con số trên bảng xếp hạng.

Đối với khách hàng doanh nghiệp, sự khác biệt đó rất quan trọng. Một tác nhân mã hóa vượt qua điểm chuẩn nhưng âm thầm đưa lỗi vào cơ sở mã sản xuất hoặc một tác nhân tài chính làm tròn số liệu không chính xác, có thể gây ra nhiều thiệt hại hơn nhiều so với mức điểm kiểm tra thấp gợi ý. Bằng cách phát hiện những lỗi đó trong hộp cát trước khi triển khai, Patronus đang định vị việc đánh giá là điều kiện tiên quyết để có được sự tin cậy chứ không phải là suy nghĩ lại.

Một cách tiếp cận khác biệt trong một lĩnh vực đông đúc

Đối với các đối thủ, Patronus tin rằng họ chủ yếu cạnh tranh với các nhóm đánh giá nội bộ mà các phòng thí nghiệm AI đã xây dựng để đánh giá hành vi của tác nhân. Trong khi các công ty dữ liệu về con người như Mercor và Surge giúp các nhà sản xuất mô hình học tập tăng cường, thì Patronus lại hoạt động khác bằng cách đánh giá cách các tác nhân hành xử mà không có sự tham gia của con người, tự động hóa việc phát hiện các lỗi mà lẽ ra phải xem xét thủ công tốn kém.

Vòng này báo hiệu sự tin tưởng của nhà đầu tư rằng việc đánh giá tác nhân sẽ trở thành lớp nền tảng của hệ thống AI. Khi các đại lý đảm nhận công việc tự chủ hơn, từ đặt chuyến đi đến tiến hành phân tích tài chính, các công ty khởi nghiệp có thể chứng minh các hệ thống đó là đáng tin cậy, trước khi chúng được triển khai, đang tự định vị mình là những người gác cổng không thể thiếu cho kỷ nguyên AI tác nhân.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →