Anthropic wis nerbitake riset sing nuduhake manawa sistem AI otomatis bisa ndandani kegagalan keselarasan model kanthi andal, asil sing bisa mbentuk maneh carane kerja safety ing tengah industri AI rampung. Makalah kasebut, kanthi irah-irahan "Peneliti Otomatis Bisa Ngurangi Kegagalan Alignment," dirilis ing dina Jumuah lan rinci dening TechCrunch.
Riset kasebut metu saka program fellows Anthropic lan dipimpin dening Chen Yueh-Han. Pratelan utama sing nggumunake: nalika sistem riset otomatis perusahaan ditunjuk ing sepuluh benchmark sing ngukur prilaku sing ora cocog, dheweke nambah kinerja ing saben siji - tanpa ngrusak kabisan sakabèhé model kasebut. Kanggo lapangan sing wis berjuang kanggo njaga karya safety ing langkah karo ukuran model, iku asil kacathet. For more context on this story, see our ongoing latest AI developments.
Crita kasebut tiba nalika sibuk kanggo jangkoan safety AI. Dipuntedahaken musim panas ing ngendi tumindak ala agen wis didominasi berita utama, saka laporan internal OpenAI babagan agen peretas ganjaran kanggo njaluk investigasi independen babagan pelanggaran Hugging Face. Kertas anyar Anthropic nyedhaki masalah saka arah sing ngelawan: tinimbang takon kepiye tumindak salah agen, dheweke takon apa agen liyane bisa dipercaya kanggo ndandani.
Apa sing Dilaporake dening Kertas
Sistem sing diterangake ing kertas kasebut diarani Peneliti Alignment Otomatis, utawa AAR. Tinimbang ngganti proses riset, AAR niru akeh: saben sistem otomatis nelusuri literatur sing kasedhiya, ngusulake cara, lan nglatih model kasebut kanthi nggunakake metode kasebut kira-kira 30 menit. Proses kasebut banjur diulang ing sawetara pengulangan.
Mekanisme pilihan iku prasaja. Cara sing mindhah pathokan dilestarekake; cara sing ora dibuwang. Daur ulang kasebut ngidini sistem bisa digunakake kanthi cepet lan ing skala sing ora ana tim manungsa sing bisa cocog, nguji akeh arah riset kanthi paralel lan mung njaga apa sing bisa ditindakake.
Miturut koran, asil kasebut konsisten ing papan. Ing kabeh sepuluh pathokan sing nyakup prilaku misaligned tartamtu, sistem otomatis ngasilake dandan sing bisa diukur tanpa ngrusak kinerja model sakabèhé - trade-off biasanipun sing nggawe alignment bisa angel.
"Sakabèhé, asil kasebut nyedhiyakake bukti awal manawa latihan pasca-latihan otomatis bisa dadi praktis ing wektu sing cedhak," ujare kertas kasebut.
Ngalahake Manungsa, ing 1/37th Biaya
Perangan sing paling akeh dikutip ing koran yaiku sing mbandhingake AAR langsung karo mitra manungsa. Anthropic ora ngalang-alangi perbandingan kasebut.
"Cara AAR paling apik ngalahake apa sing diusulake dening manungsa, rata-rata sajrone enem jam," koran kasebut maca. Iku nambah, pointedly, sing "pituduh riset dipandu manungsa ora mimpin kanggo kinerja kuwat."
Ekonomi kaya kethul. "AAR regane kira-kira $ 4 saben jam ing inferensi API nglawan $ 150 saben jam sing dibayar kanggo peneliti manungsa," panulis nulis. Iki minangka bedane biaya meh 40 kaping, lan nerangake sebabe laboratorium nindakake riset otomatis kanthi serius tinimbang penasaran.
Apa Gap Biaya Penting
Riset alignment larang kanthi cara sing gampang disepelekake. Saben intervensi calon kudu dileksanakake, dilatih, lan dievaluasi nglawan pathokan, lan umume calon gagal. Yen sistem bisa mbukak loop telusuran kasebut kanthi terus-terusan kanggo rega telpon API, biaya marginal kanggo nyoba siji gagasan maneh nyedhaki nol. Watesan kasebut ngalih saka headcount kanggo ngitung.
Watesan Anthropic dhewe Ditandani
Kertas kasebut jujur babagan asil sing ora ditetepake. Sistem otomatis mung bisa digunakake sajrone pathokan kasebut bener-bener nggambarake tujuan keselarasan sing penting - lan mbangun lan njaga pathokan sing nangkep tumindak salah ing jagad nyata tetep dadi masalah sing mbukak ing lapangan.
Ana uga ketergantungan sing gampang dilalekake: peneliti otomatis nggambar metode literatur sing ana. Njaga lan nggedhekake sastra iku dhewe karya pinunjul, lan sistem sing mung remixs Techniques dikenal bisa mencet langit-langit sing kreatifitas manungsa ora bakal.
Kaveat kasebut penting amarga pentinge riset jangka panjang gumantung marang dheweke. Yen pathokan ngukur sing salah, AAR bisa ngoptimalake cara kanggo nomer kuwat nalika risiko ndasari tetep ora kena. Framing Anthropic - "bukti awal," dudu solusi - nggambarake kahanan sing durung mesthi.
Langkah Menuju Peningkatan Diri Rekursif
Makalah kasebut uga menehi debat sing luwih gedhe babagan perbaikan diri rekursif, ide manawa sistem AI pungkasane bisa nambah proses latihan sing ngasilake. Nglatih model AI karo model AI liyane wis dadi tujuan populer kanggo laboratorium perbatasan, lan asil Anthropic minangka tampilan awal lan konkrit babagan apa sing katon ing domain sing sempit.
Logikanya langsung. Yen model bisa ngapikake latihan alignment dhewe, mesin sing padha bisa ditrapake kanggo praktik latihan kanthi luwih akeh - kalebu karya kemampuan. TechCrunch nyathet implikasi manawa peneliti AI manungsa pungkasane bisa dadi kurang penting ing proses kasebut, kemungkinan kertas kasebut dhewe melu tinimbang ngindhari.
Apa sing Dideleng Sabanjure
Telung pitakonan bakal nemtokake manawa asil iki umum. Kaping pisanan, apa pendekatan kasebut ana ing njaba sepuluh benchmark sing diuji Anthropic, babagan mode kegagalan sing luwih apik lan kurang jelas. Kapindho, apa masalah benchmark-maintenance bisa ditanggulangi kanthi cepet supaya riset otomatis jujur. Katelu, apa laboratorium liyane nerbitake asil sing padha, sing bakal ngowahi kertas siji menyang arah industri.
Saiki, temuan kasebut sempit nanging nyata: ing tugas keselarasan khusus sing diuji Anthropic, peneliti otomatis ngluwihi manungsa sing berpengalaman, luwih cepet lan luwih murah. Sisih safety industri AI bisa dadi papan pertama ing ngendi peneliti AI - dudu manungsa - nindakake sebagian besar pakaryan.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →
