Agen AI saiki bisa ngrampungake 16 persen proyek freelance nyata ing tingkat kualitas sing bakal ditampa klien sing mbayar, miturut asil paling anyar saka Indeks Tenaga Kerja Jarak Jauh - luwih saka kaping papat tingkat sing dicathet mung wolung wulan kepungkur. Panemuan kasebut nyedhiyakake salah sawijining langkah sing paling konkrit babagan sepira cepet sistem AI otonom nglanggar karya kreatif lan teknis profesional.

Indeks Tenaga Kerja Jarak Jauh (RLI), sing dikembangake dening Pusat Keamanan AI kanthi kolaborasi karo Scale Labs, nglacak sepira kerepe agen AI bisa ngrampungake proyek freelance sing larang regane kanthi kualitas profesional. Patokan kasebut kalebu lapangan kalebu desain 3D lan CAD, arsitektur, desain grafis, video lan animasi, produksi audio, analisis data, lan pangembangan aplikasi web. Iki ngevaluasi 240 proyek sing digabungake $ 144,000, saka 358 freelancer sing wis diverifikasi. Evaluator manungsa ngetung saben asil nglawan standar emas sing digawe dening profesional sing mbayar, menehi gambar empiris babagan kemampuan berkembang industri AI.

Angka-angka: Watesan sing Luwih saka Quadrupled

Nalika pathokan pisanan diluncurake, agen AI paling apik ngotomatisasi mung 2,5 persen proyek. Miturut asil paling anyar, model Anthropic's Fable 5 saiki tekan 16.1 persen - skor paling dhuwur sing tau dicathet ing indeks kasebut. Sing kira-kira tikel kaping pindho Opus 4.8 8.3 persen lan luwih saka 6.3 persen GPT-5.5.

Kabeh telung model wates ngalahake saben sistem sing wis diuji sadurunge. Pimpinan sadurunge, Opus 4.6 mlaku ing kerangka Claude Cowork, lungguh ing 4.17 persen. Kapabilitas otomatisasi wates wis luwih saka kaping papat sajrone wolung wulan, miturut penulis pathokan kasebut.

Asil ora pindhah ing lockstep karo tanggal release, Nanging. Ing leaderboard Scale Labs lengkap, Gemini 3 Pro sing luwih anyar dumunung ing sisih ngisor kanthi mung 1.25 persen, ngetutake sistem sing luwih lawas. Iki nuduhake manawa kemampuan model mentah ora kanthi otomatis nerjemahake menyang jinis panggunaan alat lan katrampilan nalar sing dibutuhake kanggo tugas profesional sing rumit.

Cara Kerjane Benchmark

Supaya model kasebut nuduhake kemampuan lengkap, tim kasebut nggunakake alat pangembangan sing padha sing digunakake para insinyur saben dina, kalebu Kode Claude lan Codex CLI. Lingkungan kasebut ditambahi kanthi kemampuan kanggo ngoperasikake program grafis kanthi langsung.

Saben agen AI bisa digunakake ing mesin Linux virtual sing ngemot luwih saka 30 aplikasi profesional, kalebu Blender kanggo model 3D, GIMP kanggo nyunting gambar, lan Audacity kanggo produksi audio. Proyek diwenehake nganti 24 jam wektu ngitung - luwih suwe tinimbang interaksi chatbot sing khas.

Persiyapan kasebut uga nggunakake loop kritikus: agen AI kapindho nyemak output kanthi kritis kaya klien sing nuntut, lan agen pisanan banjur ngowahi karyane adhedhasar umpan balik kasebut. Iki nggambarake proses iteratif sing ditindakake para freelancer manungsa nalika nyaring kiriman.

Where AI Isih Falls Short

Senadyan kemajuan sing cepet, agen AI isih gagal nggayuh kualitas profesional ing mayoritas proyek. Posting blog pathokan kasebut nyorot conto tartamtu sing sanajan output model paling dhuwur ora bakal ditindakake minangka karya rampung.

Ing tugas desain ring, Fable 5 ngasilake asil sing jelas luwih apik tinimbang upaya AI sadurunge nanging isih katon ora profesional nalika dipriksa. Ing proyek arsitektur, GPT-5.5 nggawe render sing nyenengake nggunakake generator gambar nalika model 3D sing asline tetep cacat - trabasan sing bakal ditemokake klien sing mbayar mung kanthi mbukak file sumber.

Salah sawijining tugas sing luwih rumit ing pathokan njaluk agen nggawe rencana lantai dimensi, pilihan tata letak furnitur, lan jedhing fotorealistik saka rencana kadaster sing dipindai, foto situs, lan pangukuran. Alur kerja multi-langkah iki, sing mbutuhake presisi teknis lan pertimbangan kreatif, tetep dadi tantangan sing penting kanggo sistem saiki.

AI Judges Rate Banget Generously

Tim riset uga nyoba apa evaluasi manungsa sing larang bisa diganti dening hakim AI. Wangsulan kasebut definitif: Evaluator AI menehi rating model anyar kanthi murah banget. Kanggo GPT-5.5, skor hakim AI meh kaping telu banget. Kanggo Opus 4.8, iku kira-kira loro setengah kaping dhuwur banget.

Nalika hakim otomatis entuk urutan peringkat sakabèhé kanthi bener, angka-angka nyata saya mundhak. Pusat Keamanan AI nerangake alasan kasebut: kanggo ngadili karya sing dikirim kanthi adil, evaluator kudu mbukak file ing piranti lunak profesional sing bener, ngoperasikake piranti lunak kasebut kanthi bener, lan nggawe keputusan kaya klien sing mbayar. Panggunaan piranti lunak tangan kaya ngono yaiku sing paling akeh dilawan dening agen AI saiki.

Ironi kasebut minangka instruktif: hakim AI ngalami watesan sing padha karo para pekerja AI sing kudu dievaluasi. Rendering palsu GPT-5.5 minangka salah sawijining kasus - nyekel ngapusi mbutuhake mbukak model 3D lan mriksa geometri sing nyata, tugas sing ora bisa ditindakake dening hakim AI.

Peringatan: Watesan Pamrentah

Siji caveat penting ditrapake kanggo skor anjog Fable 5 kang. Mung 218 saka 240 proyek sing bisa dievaluasi sadurunge pamrentah Amerika Serikat mbatesi akses menyang model kasebut. Malah ing skenario paling awon, ing ngendi Fable 5 gagal saben proyek sing isih ana, tingkat otomatisasi isih bakal 14.6 persen - luwih dhuwur tinimbang model liyane sing diuji.

Watesan pamrentah, sing ana gandhengane karo keprihatinan keamanan nasional babagan model kelas Mythos, mbatesi jendela evaluasi nanging ora ngrusak temuan dhasar: Agen AI kanthi cepet nyedhak menyang titik sing bisa nangani bagean sing migunani kanggo karya freelance profesional.

Kanggo para freelancer, tren kasebut nyenengake nanging durung kacilakan. AI isih gagal ing 84 persen proyek, lan conto pathokan kasebut nuduhake manawa output sing sukses asring mbutuhake revisi profesional. Nanging kanthi tingkat otomatisasi luwih saka quadrupling sajrone setahun, lintasan kasebut jelas. Pitakonan ora maneh apa agen AI bakal saingan kanggo karya freelance, nanging sepira cepet bakal nutup celah sing isih ana.

Tetep Ahead saka AI

Entuk warta, analisis, lan terobosan AI paling anyar - kabeh ing sak panggonan.

Waca liyane warta AI →