Model basa intelijen buatan mbebayani banget kanggo owah-owahan subtle babagan pilihan sing ditampilake, nanggapi nudges sing nyasarké luwih kuat tinimbang manungsa, miturut panaliten anyar sing diterbitake ing Proceedings of the National Academy of Sciences.

Panemuan kasebut nyebabake keprihatinan serius babagan nggunakake agen AI kanggo nggawe keputusan otonom ing skenario nyata, saka transaksi finansial nganti pilihan perawatan kesehatan. Minangka AI Buzz Wire wis dilaporake, perusahaan saya tambah akeh posisi agen sing didhukung LLM kanggo tumindak atas jenenge pangguna ing lingkungan sing kompleks.

Panaliten kasebut, dipimpin dening Manuel Cherep, mahasiswa doktoral ing Lab Media Institut Teknologi Massachusetts, nguji 14 model basa paling canggih saka perusahaan teknologi utama. Model sing diuji kalebu versi kulawarga OpenAI GPT-3.5, GPT-4, lan GPT-5, model Anthropic Claude 3 lan 4.5, lan model Gemini 1.5 lan 2.5 Google.

Carane Sinau Kerjane

Peneliti adaptasi game nggawe keputusan multi-atribut asline dirancang kanggo peserta manungsa. Game kasebut nampilake kothak digital sing makili bakul hadiah sing didhelikake, kanthi tujuan kanggo nggedhekake ganjaran pungkasan kanthi milih basket kanthi nilai titik paling dhuwur. Saben sel mbukak titik biaya, meksa peserta kanggo ngimbangi biaya ngumpulake informasi marang entuk manfaat saka nemokake basket luwih.

Para peneliti ngowahi game visual iki dadi format teks sing bisa diproses model basa. Model AI dimainake liwat atusan uji coba ing kahanan sing beda-beda. Sawetara nampa instruksi dhasar, sawetara nampa pituduh sing nyengkuyung logika langkah-langkah, lan liya-liyane ditampilake conto game manungsa sing kepungkur. Kanggo saben jinis nudge, peneliti nglakokake udakara 300 nganti 340 uji coba saben model, kanthi total rong milyar token teks.

Papat Jinis Nudges Diuji

Panliten kasebut nliti papat jinis nudges khusus sing dirancang kanggo niru lingkungan keputusan ing donya nyata:

  • Default nudges: Siji basket wis dipilih, lan agen kudu aktif nampa utawa nolak.
  • Saran nudges : A basket acak dianjurake salah siji awal utawa pungkasan ing game.
  • Sorotan informasi: Iki digawe luwih murah kanggo mbukak nilai hadiah tartamtu, duweni potensi ngarahake agen menyang pilihan suboptimal.
  • Nudges optimal : Sèl tartamtu wis dicethakaké ana sing matématis bakal ngoptimalake kinerja pamuter manungsa.

Tarif Kepatuhan Nguwatirake

Asil kasebut nuduhake bedane dramatis antarane prilaku nggawe keputusan manungsa lan AI.

Nalika diwenehi pilihan standar, manungsa milih standar babagan 88 persen wektu. Model basa kasebut luwih tundhuk, kanthi sawetara model nampa basket standar 99 nganti 100 persen wektu.

Pola iki tetep karo nudges saran. Manungsa nampa kranjang sing disaranake kanthi acak ing awal game 35 persen wektu. Akeh model AI sing nampa saran acak kasebut kanthi tarif sing luwih dhuwur, nuruti saran sanajan ora menehi keuntungan logis.

Wektu saran uga ngapusi model kanthi cara sing ora wajar. Nalika manungsa ngetutake saran pungkasan 25 persen wektu, sawetara model basa ngeculake tingkat panampa nganti antarane 7 lan 13 persen. Iki tegese model kasebut nanggapi kanthi ketat marang wektu isyarat tinimbang ngevaluasi kegunaane.

Mbok menawa sing paling penting, nalika peneliti nyorot pilihan suboptimal liwat panyorot informasi, manungsa nggunakake informasi sing nyasab 57 persen wektu. Model AI sing paling akeh sing diuji ngluwihi garis dasar iki, sawise sorotan ala 83 nganti 100 persen wektu.

Masalah Sing Didhelikake Konco Skor Apik

Peneliti uga nglacak carane model ngumpulake informasi sadurunge nggawe pilihan final. Manungsa cenderung mbukak sel sing cukup kanggo nggawe guess sing dididik. Model basa entuk informasi kanthi cara sing ora biasa lan ora efisien.

Sawetara model milih kranjang tanpa mbukak sel sing didhelikake, ora nggatekake kesempatan kanggo ngumpulake data. Model liyane ngginakaken TCTerms gedhe banget mbukak kabeh larik utawa kolom, mbuang hadiah potensial. Sawetara model nampilake bias spasial aneh, mung mbukak sel ing sisih kiwa kiwa kothak utawa kanthi garis diagonal.

Nyedhiyakake model kanthi pituduh penalaran langkah-langkah utawa conto saka urutane critane game manungsa mung sethithik banget kanggo ndandani kabiasaan panelusuran sing aneh iki.

Penulis nyathet yen mung ndeleng skor pungkasan bisa ndhelikake masalah dhasar kasebut. Ing sawetara uji coba, model AI entuk angka net sing padha karo pemain manungsa. Pengamat kasual mung mriksa skor pungkasan bisa uga nganggep model kasebut nggawe pilihan sing cerdas lan kaya manungsa. Ing kasunyatan, model kasebut asring entuk skor kasebut liwat kepatuhan buta tinimbang pamikiran strategis.

Yen nudge kelakon kanggo nuding menyang basket apik, AI kebacut manut ngetung apik. Nalika nudge nuding menyang basket ala, AI wuta tindakake menyang skor ngisor, rampung ilang tujuan game.

Implikasi kanggo AI Agent Deployment

"Akeh aplikasi agen AI kanthi diam-diam nganggep manawa, ing kahanan sing durung mesthi, dheweke bakal bereaksi kanthi cara sing kaya manungsa, yen ora luwih rasional," ujare Cherep. "Tinimbang nrima asumsi iki, kita mutusake kanggo njelajah kepiye tumindak agen nalika pilihan diwenehake kanthi cara sing beda-beda."

Temuan panaliten kasebut duwe implikasi sing signifikan kanggo pasar agen AI sing berkembang kanthi cepet sing dirancang kanggo browsing web, ngoperasikake alat, lan nggawe keputusan finansial utawa blanja kanggo pangguna. Yen agen kasebut kanthi wuta ngetutake opsi standar, saran, utawa informasi sing disorot tanpa evaluasi kritis, bisa gampang dimanipulasi dening aktor sing ala utawa antarmuka sing ora dirancang.

Panliten kasebut nuduhake yen model basa saiki ora duwe rasionalitas sing bisa nuntun nggawe keputusan manungsa. Nalika manungsa nggunakake trabasan mental kanggo ngimbangi biaya ngumpulake informasi marang ganjaran kanggo nggawe pilihan sing apik, model AI ora nuduhake kendala biologis kasebut, nanging dheweke nuduhake wujud irasionalitas dhewe sing bisa dibantah luwih ekstrem lan ora bisa ditebak.

Tetep Ahead saka AI

Kanggo warta lan analisis AI liyane, bukak AI Buzz Wire.

Waca liyane AI warta →