Patronus AI, sebuah syarikat permulaan yang membina persekitaran digital simulasi untuk menilai ejen AI autonomi, telah mengumpulkan $50 juta dalam pusingan Siri B apabila permintaan untuk ujian ejen yang boleh dipercayai meningkat. Pusingan itu diketuai oleh Greenfield Partners dengan penyertaan daripada Notable Capital, Lightspeed, Datadog, dan Samsung, TechCrunch melaporkan, menjadikan jumlah pembiayaan syarikat itu kepada $70 juta.
Masalah Baharu: Ejen yang Mengambil Jalan Pintas For more context on this story, see our ongoing AI news.
Apabila ejen AI berkembang daripada menjawab soalan kepada melaksanakan tugas yang kompleks dan berbilang langkah secara autonomi, penyedia model dan syarikat pemula yang membina ejen tersebut memerlukan jaminan bahawa sistem akan berprestasi dengan pasti merentas pelbagai senario. Makmal AI sering menggunakan penanda aras untuk mempamerkan kehebatan model, tetapi skor tinggi pada penanda aras berorientasikan ejen tidak membuktikan bahawa AI sebenarnya boleh mencapai pekerjaan dunia sebenar dengan betul.
Jurang itu adalah tempat tumpuan Patronus AI. Diasaskan pada 2023 oleh bekas penyelidik Meta AI Anand Kannappan dan Rebecca Qian, syarikat yang berpangkalan di San Francisco membina apa yang dipanggil "model dunia digital," replika tapak web dan sistem dalaman di mana ejen diuji tekanan selepas latihan. Ejen-ejen dinilai menggunakan pembelajaran pengukuhan, yang secara berulang memberi ganjaran kepada penyiapan tugas yang berjaya dan menghukum kesilapan.
Meminjam Daripada Kenderaan Autonomi
Syarikat itu membandingkan pendekatannya dengan cara Waymo melatih kereta pandu sendiri, mula-mula membina dunia sintetik untuk menguji kenderaan terhadap bahaya yang jarang berlaku seperti cuaca buruk atau kanak-kanak berlari mengejar bola. Perbezaan utama dengan ejen AI ialah mereka cenderung mengambil jalan pintas, yang bermaksud mereka gagal menyelesaikan tugas dengan betul walaupun apabila mereka kelihatan berjaya.
"Patronus benar-benar mahir dalam mengesan penggodaman dan memastikan mereka mempertanggungjawabkan model itu," kata Glenn Solomon, pengarah urusan di Notable Capital. Solomon menyifatkan permintaan untuk persekitaran simulasi syarikat itu hampir tidak dapat dipuaskan. Hampir setiap makmal AI sempadan dan banyak syarikat permulaan baru muncul kini menjadi pelanggan, dan hasil Patronus telah berkembang 15 kali ganda sepanjang tahun lalu.
Memperluas Melangkaui Tugasan Boleh Disahkan
Patronus pada masa ini menyediakan dunia digital simulasinya untuk kejuruteraan perisian dan kewangan, dua domain yang hasilnya agak mudah untuk disahkan. Tetapi syarikat melihat ini sebagai permulaan sahaja. "Hari ini kami sangat tertumpu pada masalah yang boleh disahkan, masalah yang anda boleh semak dan sahkan serta-merta, tetapi terdapat lebih banyak kawasan yang sangat tidak boleh disahkan atau sangat sukar untuk disahkan," kata Kannappan.
Cita-citanya adalah untuk membina persekitaran yang cukup besar untuk menguji ejen di ufuk yang panjang. "Kami mahu benar-benar dapat mewujudkan persekitaran di mana anda boleh mengendalikan ejen yang boleh berjalan selama 10 jam atau 10 hari atau 10 minggu," kata Kannappan. Hanya kerana proses boleh disahkan tidak bermakna ia mudah, dan keupayaan untuk menangkap ejen yang gagal di tengah-tengah aliran kerja selama beberapa hari adalah penting kepada cadangan nilai syarikat.
Pembiayaan juga tiba ketika industri AI yang lebih luas bergelut dengan cara mengukur kemajuan. Markah penanda aras telah menjadi mata wang yang dipertikaikan, dengan pengkritik berpendapat bahawa model boleh dioptimumkan untuk ujian khusus permainan tanpa benar-benar bertambah baik pada tugas sebenar. Persekitaran simulasi Patronus menawarkan alternatif, ejen ujian dalam senario terbuka di mana satu-satunya bukti kejayaan ialah kerja yang disiapkan dengan betul dan bukannya nombor pada papan pendahulu.
Bagi pelanggan perusahaan, perbezaan itu penting. Ejen pengekodan yang melepasi penanda aras tetapi secara senyap memperkenalkan pepijat ke dalam pangkalan kod pengeluaran, atau ejen kewangan yang membulatkan angka dengan salah, boleh menyebabkan lebih banyak kerosakan daripada yang dicadangkan oleh skor ujian rendah. Dengan menangkap kegagalan tersebut dalam kotak pasir sebelum penggunaan, Patronus meletakkan penilaian sebagai prasyarat untuk kepercayaan, bukan renungan.
Pendekatan Berbeza dalam Padang Sesak
Bagi saingan, Patronus percaya ia terutamanya bersaing dengan pasukan penilaian dalaman yang telah dibina oleh makmal AI untuk menilai tingkah laku ejen. Walaupun firma data manusia seperti Mercor dan Surge membantu pembuat model dengan pembelajaran pengukuhan, Patronus beroperasi secara berbeza dengan menilai cara ejen berkelakuan tanpa penglibatan manusia, mengautomasikan pengesanan kegagalan yang memerlukan semakan manual yang mahal.
Pusingan itu menandakan keyakinan pelabur bahawa penilaian ejen akan menjadi lapisan asas timbunan AI. Memandangkan ejen menjalankan kerja yang lebih berautonomi, daripada menempah perjalanan hingga menjalankan analisis kewangan, syarikat pemula dapat membuktikan sistem tersebut boleh dipercayai, sebelum ia digunakan, meletakkan diri mereka sebagai penjaga pintu yang sangat diperlukan kepada era AI agenik.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →


