Ejen AI kini boleh menyelesaikan 16 peratus pekerjaan bebas sebenar pada tahap kualiti yang akan diterima oleh pelanggan yang membayar, menurut keputusan terkini dari Indeks Buruh Jauh - lebih daripada empat kali ganda kadar yang dicatatkan hanya lapan bulan lalu. Penemuan ini menyediakan salah satu langkah yang paling konkrit tentang seberapa cepat sistem AI autonomi menceroboh kerja kreatif dan teknikal profesional.
Indeks Buruh Jauh (RLI), yang dibangunkan oleh Pusat Keselamatan AI dengan kerjasama Scale Labs, menjejaki kekerapan ejen AI boleh menyelesaikan projek bebas yang bernilai komersial pada kualiti profesional. Penanda aras merangkumi bidang termasuk reka bentuk 3D dan CAD, seni bina, reka bentuk grafik, video dan animasi, pengeluaran audio, analisis data dan pembangunan aplikasi web. Ia menilai 240 projek bernilai gabungan $144,000, diperoleh daripada 358 pekerja bebas yang disahkan. Penilai manusia menjaringkan setiap keputusan berbanding standard emas yang dicipta oleh profesional berbayar, menawarkan gambaran empirikal keupayaan industri AI yang semakin berkembang.
Nombor: Sempadan Yang Lebih Daripada Berempat
Apabila penanda aras pertama kali dilancarkan, ejen AI terbaik mengautomasikan hanya 2.5 peratus projek. Menurut keputusan terkini, model Anthropic's Fable 5 kini mencecah 16.1 peratus — markah tertinggi pernah direkodkan pada indeks. Itu kira-kira dua kali ganda Opus 4.8 8.3 peratus dan jauh di hadapan GPT-5.5 6.3 peratus.
Ketiga-tiga model sempadan mengalahkan setiap sistem yang diuji sebelum ini. Pemimpin terdahulu, Opus 4.6 berjalan pada rangka kerja Claude Cowork, menduduki 4.17 peratus. Sempadan keupayaan automasi telah meningkat lebih daripada empat kali ganda dalam tempoh kurang lapan bulan, menurut pengarang penanda aras itu.
Walau bagaimanapun, keputusan tidak bergerak mengikut lockstep dengan tarikh keluaran. Pada papan pendahulu Scale Labs penuh, Gemini 3 Pro yang lebih baharu mendarat berhampiran bahagian bawah pada hanya 1.25 peratus, ketinggalan di belakang sistem yang lebih lama. Ini menunjukkan bahawa keupayaan model mentah tidak diterjemahkan secara automatik ke dalam jenis penggunaan alat dan kemahiran penaakulan yang diperlukan untuk tugas profesional yang kompleks.
Bagaimana Penanda Aras Berfungsi
Untuk membolehkan model menunjukkan keupayaan penuh mereka, pasukan menjalankannya dalam alat pembangunan yang sama yang jurutera gunakan hari ke hari, termasuk Kod Claude dan Codex CLI. Persekitaran ini telah diperluaskan dengan keupayaan untuk mengendalikan program grafik secara langsung.
Setiap ejen AI berfungsi dalam mesin Linux maya yang dimuatkan dengan lebih 30 aplikasi profesional, termasuk Blender untuk pemodelan 3D, GIMP untuk penyuntingan imej dan Audacity untuk pengeluaran audio. Projek diberikan sehingga 24 jam masa pengiraan — jauh lebih lama daripada interaksi chatbot biasa.
Persediaan juga menggunakan gelung pengkritik: ejen AI kedua menyemak output secara kritikal seperti pelanggan yang menuntut, dan ejen pertama kemudian menyemak kerjanya berdasarkan maklum balas tersebut. Ini mencerminkan proses berulang yang diikuti oleh pekerja bebas semasa memperhalusi penghantaran.
Di mana AI Masih Kurang
Walaupun kemajuan pesat, ejen AI masih gagal mencapai kualiti profesional pada sebahagian besar projek. Catatan blog penanda aras menyerlahkan contoh khusus di mana walaupun output model teratas tidak akan lulus sebagai kerja siap.
Mengenai tugas reka bentuk cincin, Fable 5 menghasilkan hasil yang jelas lebih baik daripada percubaan AI sebelumnya tetapi masih kelihatan tidak profesional apabila diperiksa dengan teliti. Pada projek seni bina, GPT-5.5 memalsukan render yang menarik menggunakan penjana imej manakala model 3D asasnya yang sebenar kekal cacat — pintasan yang pelanggan yang membayar akan temui hanya dengan membuka fail sumber.
Salah satu tugas yang lebih kompleks dalam penanda aras meminta ejen untuk membuat pelan lantai berdimensi, pilihan susun atur perabot dan pemaparan bilik mandi fotorealistik daripada pelan kadaster yang diimbas, foto tapak dan ukuran. Aliran kerja berbilang langkah ini, yang memerlukan ketepatan teknikal dan pertimbangan kreatif, kekal sebagai cabaran penting untuk sistem semasa.
Hakim AI Menilai Terlalu Murah
Pasukan penyelidik juga menguji sama ada penilaian manusia yang mahal boleh digantikan oleh hakim AI. Jawapannya adalah muktamad: Penilai AI menilai model baharu terlalu murah hati. Untuk GPT-5.5, skor hakim AI hampir tiga kali terlalu tinggi. Untuk Opus 4.8, ia adalah kira-kira dua setengah kali terlalu tinggi.
Walaupun hakim automatik mendapat susunan kedudukan keseluruhan dengan betul, angka sebenar meningkat dengan ketara. Pusat Keselamatan AI menjelaskan alasannya: untuk menilai kerja yang disampaikan secara adil, penilai mesti membuka fail dalam perisian profesional yang betul, mengendalikan perisian itu dengan betul dan membentuk penghakiman seperti pelanggan yang membayar. Penggunaan perisian hands-on seperti itu adalah perkara yang paling sering dihadapi oleh ejen AI semasa.
Ironinya adalah pengajaran: hakim AI menghadapi batasan yang sama seperti pekerja AI yang sepatutnya dinilai. Penyampaian palsu GPT-5.5 adalah contoh contoh — menangkap penipuan memerlukan membuka model 3D dan memeriksa geometri sebenar, satu tugas yang tidak boleh dilakukan oleh hakim AI dengan pasti.
Kaveat: Sekatan Kerajaan
Satu kaveat penting digunakan untuk skor utama Fable 5. Hanya 218 daripada 240 projek boleh dinilai sebelum kerajaan Amerika Syarikat menyekat akses kepada model tersebut. Walaupun dalam senario terburuk, di mana Fable 5 gagal setiap projek yang tinggal, kadar automasinya masih 14.6 peratus — lebih tinggi daripada model lain yang diuji.
Sekatan kerajaan, yang dikaitkan dengan kebimbangan keselamatan negara tentang model kelas Mythos, mengehadkan tetingkap penilaian tetapi tidak menjejaskan penemuan asas: Ejen AI dengan pantas menghampiri tahap di mana mereka boleh mengendalikan bahagian yang bermakna dalam kerja bebas profesional.
Bagi pekerja bebas, trend ini membimbangkan tetapi belum lagi membawa bencana. AI masih gagal pada 84 peratus projek, dan contoh penanda aras menunjukkan bahawa walaupun output yang berjaya sering memerlukan semakan profesional. Tetapi dengan kadar automasi lebih daripada empat kali ganda dalam masa kurang setahun, trajektori adalah jelas. Persoalannya bukan lagi sama ada ejen AI akan bersaing untuk kerja bebas, tetapi seberapa cepat mereka akan menutup jurang yang tinggal.
Kekal Mendahului AI
Dapatkan berita, analisis dan penemuan terkini AI — semuanya di satu tempat.
Baca lebih banyak berita AI →


