Sebuah startup AI baru yang didirikan oleh mantan peneliti OpenAI telah meluncurkan apa yang mereka sebut sebagai kelas model yang benar-benar baru — model yang tidak dapat menulis esai untuk Anda, dan mengatakan bahwa itulah intinya.

TypeSafe AI pada hari Selasa mengumumkan peluncuran "Model Sistem Satu" pertamanya, bernama Jev, yang segera tersedia dalam akses awal. Perusahaan ini didirikan oleh Diogo Almeida, yang mengatakan bahwa penelitian di balik mengikuti instruksi ChatGPT bermula dari kontribusinya di OpenAI. Setelah dua tahun diam-diam, ia berargumentasi bahwa fiksasi industri terhadap chat telah mengaburkan kegagalan otomasi. For more context on this story, see our ongoing AI trends.

"Model telah menjadi manusia super dalam obrolan selama bertahun-tahun, jadi di mana semua otomatisasinya?" Tulis Almeida di postingan peluncuran. "Itulah pertanyaan mengemudi saya selama empat tahun terakhir."

Apa Sebenarnya Model 'Sistem Satu'

Nama ini diambil dari perbedaan psikologi antara pemikiran yang cepat dan naluriah dan pemikiran yang lambat dan disengaja. Ketika model bahasa besar menghasilkan token teks demi token — fleksibel, umum, dan kadang-kadang rentan terhadap omong kosong yang penuh percaya diri — Jev TypeSafe dibuat untuk melakukan sesuatu yang lebih sempit: mengambil keadaan tidak terstruktur sebagai masukan dan mengembalikan keputusan terstruktur yang diketik dengan probabilitas yang dikalibrasi.

Perusahaan tersebut menggambarkan Jev sebagai "panggilan fungsi intelijen terdepan: keadaan tidak terstruktur, keputusan probabilistik yang diketik". Karena kemungkinan keluaran telah ditentukan sebelumnya dan model tidak pernah menghasilkan string bentuk bebas, TypeSafe mengklaim bahwa model tersebut tidak dapat menghasilkan kesalahan ketik — sebuah properti yang menurut perusahaan dijamin secara matematis daripada kemungkinan secara statistik — dan tidak dapat berhalusinasi seperti yang dapat dilakukan oleh model penghasil teks.

Arsitektur tersebut berangkat dari praktik arus utama dalam tiga cara, menurut postingan peluncuran: arsitektur model baru, sampler paralel yang menghasilkan semua keluaran dalam satu kueri, bukan secara berurutan, dan metode pelatihan yang disebut perusahaan sebagai Reinforcement Learning for Calibrated Decisions (RLCD), yang mengoptimalkan probabilitas yang jujur ​​secara epistemik, bukan preferensi manusia atau keluaran yang dapat diverifikasi secara terprogram.

Klaim: 100x Lebih Cepat, Biaya Lebih Rendah

Jumlah yang diterbitkan TypeSafe sangat agresif. Perusahaan mengatakan Jev memberikan kecerdasan yang sebanding dengan LLM frontier yang ada pada apa yang disebut tugas "berbentuk Sistem Satu" - klasifikasi, perutean, penilaian, ekstraksi, dan keputusan percabangan - sambil merespons dalam 70 hingga 500 milidetik, dibandingkan waktu respons ujung ke ujung 3 hingga 329 detik untuk model frontier. Itu berhasil 40x hingga 200x lebih cepat, kata perusahaan itu.

Penetapan harga juga tidak konvensional: $0,042 per juta token masukan, dengan token keluaran gratis, karena keluaran dihitung secara paralel dan bukan dihasilkan token demi token. Perusahaan mengakui dalam postingannya bahwa mereka belum dapat membuktikan bahwa penetapan harga tersebut berkelanjutan dalam skala besar.

“Klaim yang luar biasa membutuhkan bukti yang luar biasa,” tulis postingan tersebut, sebelum memberikan bukti yang dimilikinya.

Tanda Terima — dan Apa Kata Orang yang Skeptis

TypeSafe menerbitkan demo berdampingan yang membandingkan Jev dengan GPT-5.6 Terra, yang digambarkan sebagai model perbatasan paling sebanding dengan kecerdasan serupa, dan mengatakan bahwa satu-satunya ketidaksepakatan dalam rekaman tersebut melibatkan keputusan penilaian yang benar-benar ambigu. Jev juga memperkenalkan metodologi "workflow eval" baru yang mengukur model berdasarkan konsensus model eksternal terbesar - Astra OpenAI dan Fable Anthropic - di dalam grafik komputasi tetap, dan mengklaim Jev "memiliki batas Pareto hampir 2 kali lipat."

Khususnya, perusahaan menerbitkan postingan berjudul "antibenchmaxxing" yang menjelaskan mengapa mereka menghindari tolok ukur tradisional, dengan alasan bahwa model yang dirancang untuk keputusan terstruktur dalam alur kerja perangkat lunak menolak perbandingan global yang berarti.

Reaksi di Hacker News, di mana peluncuran tersebut menarik ratusan poin dalam beberapa jam, berkisar dari kegembiraan yang tulus hingga skeptisisme yang tajam. Beberapa komentator mencatat bahwa bukti publik sebagian besar terdiri dari video demo – termasuk video yang menunjukkan model yang menjalankan alur permainan Doom – dan bukan evaluasi pihak ketiga yang dapat direproduksi. Yang lain berpendapat bahwa pendekatan ini paling baik dipahami sebagai pengklasifikasi kualitas terdepan yang sangat cepat, berguna untuk sebagian beban kerja daripada sebagai pengganti LLM.

Bahkan para pengamat yang bersimpati pun membingkai beban pembuktian dengan jelas. "Ya, mereka berbicara sebagai orang yang skeptis tetapi tidak memberikan banyak bukti, selain beberapa video demo," tulis seorang pemberi komentar. “Demo langsung akan jauh lebih meyakinkan.”

Mengapa Itu Mungkin Penting

Pitchnya mendarat di titik yang sangat menyakitkan. Sebagian besar panggilan LLM produksi dalam perangkat lunak komersial tidak bersifat generatif sama sekali — melainkan berupa penilaian biner, penetapan kategori, dan keputusan perutean yang dikemas dalam bentuk prosa. Jika suatu model dapat melakukan panggilan tersebut dengan keyakinan terkalibrasi pada 70 milidetik dan secara efektif nol biaya output, maka keekonomian perangkat lunak yang didukung AI akan banyak berubah: antarmuka pengguna real-time menjadi praktis, dan langkah-langkah pipeline yang terlalu mahal untuk diotomatisasi dengan LLM menjadi cukup murah untuk dijalankan di mana saja.

Kasus penggunaan yang disarankan TypeSafe mencakup mengklasifikasikan dan merutekan data, memverifikasi dan menjaga keluaran LLM, mendeteksi jailbreak, dan analisis pengurangan peta pada kumpulan data besar — ​​beban kerja di mana kode di sekitarnya dapat membatasi kebebasan model dan menangkap kesalahan.

Perusahaan ini berterus terang mengenai pertanyaan terbuka ini: evaluasi yang dipublikasikan dijalankan dari laptop di Pantai Barat AS, dan keberlanjutan penetapan harga jangka panjang masih belum terbukti. Apakah klaim kecerdasan Jev dapat bertahan melalui pengujian independen akan menentukan apakah "Model Sistem Satu" menjadi suatu kategori atau keingintahuan.

Akses awal sekarang dibuka melalui situs web perusahaan.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →