Permulaan AI baharu yang diasaskan oleh bekas penyelidik OpenAI telah melancarkan apa yang dipanggil kelas model yang sama sekali baharu — satu yang tidak boleh menulis esei kepada anda, dan mengatakan itulah hakikatnya.

TypeSafe AI mengumumkan pada hari Selasa pengeluaran "Model Satu Sistem" pertamanya, bernama Jev, tersedia serta-merta dalam akses awal. Syarikat itu diasaskan oleh Diogo Almeida, yang mengatakan penyelidikan di sebalik arahan arahan ChatGPT berkembang daripada kerja yang disumbangkannya di OpenAI. Selepas dua tahun berselindung, dia berhujah bahawa penetapan industri pada sembang telah mengaburkan di mana automasi sebenarnya gagal. For more context on this story, see our ongoing AI industry coverage.

"Model telah menjadi manusia luar biasa dalam sembang selama bertahun-tahun, jadi di manakah semua automasi?" Almeida menulis dalam catatan pelancaran. "Itu telah menjadi soalan memandu saya selama empat tahun yang lalu."

Apakah Model 'System One' Sebenarnya

Nama itu meminjam daripada perbezaan psikologi antara pemikiran cepat, naluri dan penaakulan yang perlahan dan disengajakan. Apabila model bahasa besar menjana token teks mengikut token — fleksibel, umum dan terdedah kepada karut yakin sekali-sekala — TypeSafe's Jev dibina untuk melakukan sesuatu yang lebih sempit: ambil keadaan tidak berstruktur sebagai input dan pulangan ditaip, keputusan berstruktur dengan kebarangkalian yang ditentukur dilampirkan.

Syarikat itu menggambarkan Jev sebagai "panggilan fungsi perisikan sempadan: keadaan tidak berstruktur masuk, menaip keputusan kebarangkalian." Oleh kerana kemungkinan keluaran ditakrifkan terlebih dahulu dan model itu tidak pernah menghasilkan rentetan bentuk bebas, TypeSafe mendakwa ia tidak boleh menghasilkan ralat jenis — harta yang syarikat katakan dijamin secara matematik dan bukannya kemungkinan statistik — dan tidak boleh berhalusinasi dengan cara model penjanaan teks boleh.

Seni bina berlepas daripada amalan arus perdana dalam tiga cara, mengikut jawatan pelancaran: seni bina model baharu, pensampel selari yang menghasilkan semua output dalam satu pertanyaan dan bukannya secara berurutan, dan kaedah latihan yang syarikat panggil Pembelajaran Pengukuhan untuk Keputusan Ditentukur (RLCD), yang mengoptimumkan untuk kebarangkalian jujur ​​secara epistemologi dan bukannya keluaran pilihan atau program yang boleh disahkan oleh manusia.

Tuntutan: 100x Lebih Pantas, Sedikit Daripada Kos

Nombor TypeSafe yang diterbitkan adalah agresif. Syarikat itu berkata Jev menyampaikan risikan yang setanding dengan LLM sempadan sedia ada mengenai tugasan "berbentuk Sistem Satu" — keputusan klasifikasi, penghalaan, pemarkahan, pengekstrakan dan percabangan — sambil bertindak balas dalam 70 hingga 500 milisaat, terhadap masa tindak balas hujung ke hujung 3 hingga 329 saat untuk model sempadan. Itu berfungsi 40x hingga 200x lebih pantas, kata syarikat itu.

Harga juga tidak konvensional: $0.042 setiap juta token input, dengan token keluaran percuma, kerana output dikira secara selari dan bukannya token yang dijana oleh token. Syarikat itu mengakui dalam jawatannya bahawa ia belum dapat membuktikan harga itu mampan pada skala.

"Tuntutan luar biasa memerlukan bukti luar biasa," tulis siaran itu, sebelum menawarkan bukti yang ada.

Resit — dan Apa yang Dikatakan oleh Orang Yang Skeptis

TypeSafe menerbitkan demo bersebelahan yang membandingkan Jev dengan GPT-5.6 Terra, yang disifatkannya sebagai model sempadan paling setanding pada kecerdasan yang sama, dan mengatakan satu-satunya perselisihan dalam larian yang direkodkan melibatkan panggilan penghakiman yang benar-benar samar-samar. Ia juga memperkenalkan metodologi "eval aliran kerja" baharu yang mengukur model terhadap konsensus model luaran terbesar — ​​Astra OpenAI dan Anthropic’s Fable — di dalam graf pengiraan tetap, dan mendakwa Jev "memiliki sempadan Pareto untuk hampir 2 susunan magnitud."

Terutamanya, syarikat itu menerbitkan siaran yang disertakan bertajuk "antibenchmaxxing" yang menjelaskan mengapa ia mengelakkan penanda aras tradisional, dengan alasan bahawa model yang direka untuk keputusan berstruktur dalam aliran kerja perisian menentang perbandingan global yang bermakna.

Reaksi terhadap Berita Hacker, di mana pelancaran itu menarik ratusan mata dalam beberapa jam, berkisar dari keterujaan yang tulen kepada keraguan yang tajam. Beberapa pengulas menyatakan bahawa bukti awam sebahagian besarnya terdiri daripada video demo — termasuk yang menunjukkan model yang menjanakan gelung permainan Doom — dan bukannya penilaian pihak ketiga yang boleh dihasilkan semula. Yang lain berpendapat pendekatan itu paling baik difahami sebagai pengelas kualiti sempadan yang sangat pantas, berguna untuk sepotong beban kerja dan bukannya pengganti untuk LLM.

Malah pemerhati yang bersimpati merangka beban pembuktian dengan jelas. "Ya, mereka bercakap sebagai skeptik tetapi tidak menawarkan banyak bukti, selain beberapa video demo," tulis seorang pengulas. "Demo secara langsung akan menjadi lebih meyakinkan."

Mengapa Ia Mungkin Penting Bagaimanapun

Padang mendarat pada titik kesakitan yang sebenar. Sebilangan besar panggilan LLM pengeluaran dalam perisian komersial tidak generatif sama sekali — ia adalah pertimbangan binari, penetapan kategori dan keputusan penghalaan yang dibungkus dalam prosa. Jika model boleh membuat panggilan tersebut dengan keyakinan yang ditentukur pada 70 milisaat dan kos keluaran sifar secara berkesan, ekonomi perisian berkuasa AI berubah dengan ketara: antara muka pengguna masa nyata menjadi praktikal dan langkah saluran paip yang terlalu mahal untuk diautomasikan dengan LLM menjadi cukup murah untuk dijalankan di mana-mana sahaja.

Kes penggunaan yang dicadangkan TypeSafe termasuk mengelaskan dan menghala data, mengesahkan dan menjaga output LLM, mengesan jailbreak dan analisis pengurangan peta ke atas set data yang besar — ​​beban kerja yang mana kod sekeliling boleh mengekang kebebasan model dan menangkap ralat.

Syarikat itu berterus terang tentang soalan terbuka: eval yang diterbitkan dijalankan daripada komputer riba di Pantai Barat AS, dan kemampanan harga jangka panjang masih tidak terbukti. Sama ada dakwaan perisikan Jev bertahan daripada sentuhan dengan ujian bebas akan menentukan sama ada "Model Sistem Satu" menjadi kategori atau rasa ingin tahu.

Akses awal dibuka sekarang melalui laman web syarikat.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →