Penanda aras AI menentukan model mana yang menjadi tajuk utama — dan syarikat yang membina model tersebut telah mempelajari cara untuk mengalahkannya. Permulaan yang dipanggil Vals, ditubuhkan pada 2024, bertaruh bahawa industri memerlukan pengadil yang ujiannya tidak boleh dimainkan, dan pelabur hanya menyokong pertaruhan itu secara besar-besaran: Vals mengumpul $40 juta Siri A yang diketuai oleh Andreessen Horowitz bulan lepas, berikutan pusingan benih yang diketuai oleh 8VC dan Bloomberg Beta.

Kebangkitan syarikat berlaku di tengah-tengah rasa tidak senang yang semakin meningkat tentang cara keupayaan AI diukur, dan apa yang berlaku apabila kayu ukur menjadi alat pemasaran. Untuk maklumat lanjut tentang perniagaan AI, ikuti liputan industri AI.

Apabila Penanda Aras Menjadi Pemasaran

Penandaarasan telah menjadi norma industri untuk mengesahkan keupayaan model AI — dan, apabila jumlah itu mengubah arah syarikat, untuk keunggulan pengiklanan berbanding pesaing. Penanda aras yang baik bermakna perhubungan awam yang baik.

Masalahnya, menurut pengasas bersama dan Ketua Pegawai Eksekutif Vals Rayan Krishnan, ialah banyak penanda aras warisan dibina untuk model generasi terdahulu, dan syarikat telah memikirkan cara untuk mengoptimumkan terhadapnya. Apabila bahan ujian didedahkan kepada umum, model boleh dilatih dengan berkesan untuk lulus peperiksaan — amalan yang disifatkan oleh industri sebagai pencemaran, overfitting atau penipuan langsung.

"Kami melihat sekumpulan model baharu yang sangat berkebolehan datang ke pasaran dengan cepat, dan penanda aras akademik [tidak] mengikuti kemajuan sempadan itu," kata Krishnan dalam temu bual dengan TechCrunch.

Ujian Persendirian, Tugasan Dunia Sebenar

Vals mengambil pendekatan berbeza pada dua bahagian. Pertama, ia tidak mendedahkan bahan ujian khususnya secara terbuka, yang menjadikannya jauh lebih sukar bagi syarikat untuk melatih modelnya terhadap peperiksaan. Kedua, bukannya mengukur pengetahuan abstrak — sama ada model boleh menjawab soalan gaya peperiksaan bar — Vals menilai cara model melaksanakan tugas yang kompleks dalam industri tertentu seperti undang-undang, kewangan dan pengekodan.

"Apa yang kami lakukan sebenarnya adalah melihat apakah impak sebenar model," kata Krishnan. "Bolehkah mereka melakukan kerja yang menghasilkan produk dengan kualiti yang sama seperti manusia dalam setiap domain?"

Syarikat juga mengukur mod kegagalan, bukan hanya kejayaan. Krishnan berkata, Vals berhasrat untuk menganalisis "jika model ini menjadi liar di dunia, apakah implikasi negatifnya" — falsafah penilaian yang menganggap risiko menurun sebagai output yang boleh diukur dan bukannya difikirkan semula.

Daripada Undang-undang dan Kewangan kepada Konvensyen Genevas dan Pembaikan Diri Rekursif

Skop penilaian Vals terus berkembang melangkaui akar perkhidmatan profesionalnya. Di samping penanda aras undang-undang, kewangan dan pengekodan, Krishnan berkata syarikat itu kini menjalankan ujian dalam kesihatan mental, keselamatan siber dan biosekuriti, malah penanda aras mengenai peningkatan diri secara rekursif - topik yang lebih biasa dibincangkan dalam kalangan keselamatan AI berbanding dalam suite penilaian komersial.

Mungkin yang paling menarik ialah kerjanya mengenai undang-undang konflik bersenjata, di mana Vals sedang menguji cara model memahami dan menggunakan Konvensyen Geneva. Keluasan menandakan dari mana permintaan datang: bukan sahaja makmal berlumba-lumba ke papan pendahulu teratas, tetapi perusahaan dan institusi yang memerlukan bukti tentang cara model berkelakuan dalam domain berkepentingan tinggi sebelum menggunakannya.

Model Perniagaan: Bayar untuk Mengambil Ujian

Syarikat membayar Vals untuk menilai model mereka — susunan yang mungkin kelihatan berlawanan dengan intuisi. Mengapa syarikat membayar untuk hasil yang mungkin memalukannya? Krishnan membandingkan model itu dengan pelajar yang membayar Lembaga Kolej untuk mengambil SAT: pengukuran bebas, malah tidak menarik, membantu syarikat menyelesaikan masalah dan bertambah baik dari semasa ke semasa.

Pasaran nampaknya bertindak balas. Vals berkata pendapatannya pada masa ini lapan kali ganda berbanding tahun lepas, dan pasukannya telah meningkat tiga kali ganda sejak awal tahun, berkembang daripada lapan orang kepada 25. Syarikat itu beroperasi dari pejabat dua tingkat di Jalan Folsom San Francisco - bekas bangunan kilang bir yang kini menempatkan berbilang syarikat pemula.

Penilaian juga menjadi faktor membuat keputusan untuk perusahaan membeli-belah untuk model AI, menurut syarikat itu, memberikan penanda aras peranan yang lebih dekat kepada usaha wajar daripada pemasaran.

Pengasas Berusia 25 Tahun Dengan Tempat Duduk Barisan Depan

Krishnan, 25, menjalani latihan di Palantir dan, sebagai sarjana di Stanford, bekerja untuk Microsoft dan makmal kecerdasan buatan yang terkenal di universiti itu. Beliau berkata Vals dilahirkan daripada melihat penilaian ketinggalan di belakang industri yang sepatutnya diukur - jurang yang hanya semakin melebar apabila model baharu tiba lebih cepat daripada penanda aras akademik boleh direka, disahkan dan diterbitkan.

Permulaan kini menyertai kohort kecil tetapi semakin berkembang syarikat yang cuba menginstitusikan penilaian AI, ruang yang merangkumi usaha akademik, projek papan pendahulu sumber terbuka dan institut keselamatan. Apa yang membezakan Vals ialah model ujian persendiriannya dan tumpuannya pada penilaian berbayar, khusus industri dan bukannya kedudukan awam.

Mengapa Ia Penting

Masalah kredibiliti industri AI dengan penanda aras didokumenkan dengan baik: set ujian bocor, lonjakan papan pendahulu yang mencurigakan dan dakwaan pemasaran yang mengatasi prestasi dunia sebenar. Jika pembeli — terutamanya perusahaan dan kerajaan — mula bergantung pada penilaian berasaskan tugas persendirian seperti Vals, insentif untuk pembangun model boleh beralih daripada pengajaran kepada ujian ke arah keupayaan tulen.

Itu masih jauh dari diselesaikan. Penanda aras persendirian masih meminta pembeli mempercayai pengadil, dan pelanggan Vals adalah syarikat yang sama yang digredkan. Tetapi dengan $40 juta Siri A, pertumbuhan hasil lapan kali ganda dan permintaan yang merangkumi kewangan kepada biosekuriti, pertaruhannya ialah penilaian perasaan bebas menjadi infrastruktur — perkhidmatan yang akan dibayar oleh ekonomi AI untuk sama ada hasilnya memuaskannya atau tidak.

Kekal Mendahului AI

Siapa yang mengukur pengukur? Ikuti perniagaan penilaian AI dan syarikat pemula yang membentuknya semula di AI Buzz Wire, sumber anda untuk berita terbaharu AI.

Baca berita AI terkini →