Patronus AI, startup sing mbangun lingkungan digital simulasi kanggo ngevaluasi agen AI otonom, wis ngunggahake $50 yuta ing babak Seri B amarga panjaluk tes agen sing dipercaya mundhak. Babak kasebut dipimpin dening Greenfield Partners kanthi partisipasi saka Notable Capital, Lightspeed, Datadog, lan Samsung, lapor TechCrunch, nggawa total dana perusahaan dadi $ 70 yuta.
Masalah Anyar: Agen sing Nggawe Trabasan For more context on this story, see our ongoing AI trends.
Nalika agen AI berkembang saka mangsuli pitakon menyang otonom nglakokake tugas sing kompleks, multi-langkah, panyedhiya model lan pambangun wiwitan, agen kasebut butuh jaminan manawa sistem kasebut bakal nindakake kanthi andal ing macem-macem skenario. Lab AI asring nggunakake pathokan kanggo nuduhake kaprigelan model, nanging skor dhuwur ing pathokan sing berorientasi agen ora mbuktekake manawa AI bisa nindakake pakaryan nyata kanthi bener.
Celah kasebut minangka fokus Patronus AI. Didegake ing taun 2023 dening mantan peneliti Meta AI Anand Kannappan lan Rebecca Qian, perusahaan sing berbasis ing San Francisco mbangun apa sing diarani "model donya digital," replika situs web lan sistem internal ing ngendi agen diuji stres sawise latihan. Agen kasebut dievaluasi nggunakake pembelajaran penguatan, sing menehi ganjaran kanthi sukses ngrampungake tugas lan ngukum kesalahan.
Nyilih Saka Kendaraan Otonom
Perusahaan kasebut mbandhingake pendekatan babagan cara Waymo nglatih mobil sing nyopir dhewe, pisanan mbangun jagad sintetik kanggo nyoba kendaraan nglawan bebaya langka kayata cuaca sing abot utawa bocah sing mlayu sawise bal. Bentenane utama karo agen AI yaiku dheweke cenderung njupuk trabasan, tegese dheweke gagal ngrampungake tugas kanthi bener sanajan katon sukses.
"Patronus pancen apik kanggo ngerteni hacks lan nggawe manawa model kasebut tanggung jawab," ujare Glenn Solomon, direktur pangurus ing Notable Capital. Solomon nggambarake panjaluk kanggo lingkungan simulasi perusahaan meh ora kepenak. Sakbenere kabeh lab AI perbatasan lan akeh startup sing berkembang saiki dadi pelanggan, lan penghasilan Patronus wis tambah 15 kali lipat sajrone taun kepungkur.
Ngembangake Ngluwihi Tugas sing Bisa Diverifikasi
Patronus saiki nyedhiyakake jagad digital simulasi kanggo rekayasa piranti lunak lan keuangan, rong domain sing asile gampang diverifikasi. Nanging perusahaan ndeleng iki minangka wiwitan. "Dina iki kita fokus banget ing masalah sing bisa diverifikasi, masalah sing bisa langsung dipriksa lan diverifikasi, nanging ana ton luwih akeh wilayah sing ora bisa diverifikasi utawa angel banget kanggo verifikasi," ujare Kannappan.
Ambisi kanggo mbangun lingkungan cukup substansial kanggo nyoba agen liwat cakrawala dawa. "Kita pengin bisa nggawe lingkungan sing sampeyan bisa ngoperasikake agen sing bisa mlaku sajrone 10 jam utawa 10 dina utawa 10 minggu," ujare Kannappan. Mung amarga proses bisa diverifikasi ora ateges gampang, lan kemampuan kanggo nyekel agen sing gagal sajrone alur kerja sajrone pirang-pirang dina dadi pusat proposisi nilai perusahaan.
Pendanaan kasebut uga teka amarga industri AI sing luwih jembar babagan cara ngukur kemajuan. Skor pathokan wis dadi mata uang sing ditandingi, karo kritikus sing mbantah manawa model bisa dioptimalake kanggo tes khusus game tanpa nambah kanthi nyata ing tugas nyata. Lingkungan simulasi Patronus nawakake alternatif, agen testing ing skenario mbukak-rampung ngendi mung bukti sukses proyek bener rampung tinimbang nomer ing leaderboard.
Kanggo pelanggan perusahaan, prabédan kasebut penting. Agen kodhe sing ngliwati pathokan nanging kanthi meneng ngenalake kewan omo menyang basis kode produksi, utawa agen keuangan sing salah ngitung angka, bisa nyebabake karusakan luwih akeh tinimbang skor tes sing kurang. Kanthi nyekel kegagalan kasebut ing kothak wedhi sadurunge nyebarake, Patronus netepake evaluasi minangka prasyarat kanggo kapercayan, dudu dipikirake.
Pendekatan Beda ing Lapangan Rame
Kanggo saingan, Patronus percaya utamane saingan karo tim evaluasi internal sing wis dibangun laboratorium AI kanggo netepake prilaku agen. Nalika perusahaan data manungsa kayata Mercor lan Surge mbantu nggawe model kanthi sinau penguatan, Patronus beroperasi kanthi beda kanthi ngevaluasi cara tumindak agen tanpa keterlibatan manungsa, ngotomatisasi deteksi kegagalan sing mbutuhake review manual sing larang.
Babak kasebut menehi kapercayan investor yen evaluasi agen bakal dadi lapisan dhasar tumpukan AI. Nalika agen nindakake pakaryan sing luwih otonom, saka lelungan lelungan nganti nganakake analisis finansial, para pemula bisa mbuktekake manawa sistem kasebut bisa dipercaya, sadurunge disebarake, posisine awake dhewe minangka penjaga gerbang sing penting kanggo jaman AI agen.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →


