OpenAI nolak maneh sawise Anthropic's Claude Opus 5 ndominasi pathokan ARC-AGI-3, nerbitake asil sing nuduhake model GPT-5.6 Sol dhewe sing tekan 38.3 persen - yen sampeyan nggunakake setelan pilihan OpenAI tinimbang sabuk uji resmi.

Sengketa kasebut, sing ditindakake tanggal 30 Juli 2026, nyebabake masalah sing saya tambah akeh ing evaluasi AI: benchmarks ora mung ngukur model, nanging kabeh perancah teknis sing dibungkus. Kanggo analisis sing luwih jero babagan perkembangan AI paling anyar lan rilis model, AI Buzz Wire nglacak crita kasebut.

Angka lan Catch

OpenAI kacarita sing GPT-5.6 Sol tekan 38.3 persen ing ARC-AGI-3, edging liwat Anthropic kang Claude Opus 5, kang ngetung 30.2 persen sawise Duwe sadurunge quadrupled cathetan pathokan. Caveat kasebut penting: angka 38,3 persen gumantung marang rong fitur spesifik saka OpenAI's Responses API.

Kapisan yaiku Retained Reasoning, sing njaga rantai pamikiran model ing antarane langkah-langkah tinimbang mbuwang sawise saben tumindak. Kapindho yaiku Compaction, sing ngringkes konteks lawas tinimbang ngethok, ngidini model bisa terus nggarap masalah sing dawa tanpa kelangan pertimbangan sadurunge.

Mbukak liwat sabuk standarisasi resmi ARC Prize - sing sengaja ngindhari setelan khusus panyedhiya kanggo mesthekake perbandingan apel-kanggo-apel - GPT-5.6 Sol mung 7,8 persen. Alesane, OpenAI ujar, yaiku persiyapan resmi mbuwang pertimbangan model sawise saben langkah, ngrusak kinerja tugas sing mbutuhake pamikiran multi-langkah sing terus-terusan.

Benchmark Dibangun kanggo Kemurnian

ARC-AGI-3 dirancang dening François Chollet lan tim ARC Prize kanggo nyelidiki kemampuan model kanggo ngrampungake teka-teki penalaran novel sing durung nate dideleng sadurunge - tes intelijen umum tinimbang kawruh sing diapalake. Kanggo njaga perbandingan sing adil, sabuk resmi kanthi sengaja ngilangi fitur khusus panyedhiya, ngukur kemampuan model mentah ing lingkungan sing netral.

Bantahan OpenAI yaiku netralitas iki bisa dadi cacat. Perusahaan kasebut negesake manawa sabuk resmi ngandelake "API lengkap gaya OpenAI" lawas sing ora duwe kemampuan API Claude sing wis ditawakake, kanthi efektif ndadekake OpenAI dadi kerugian struktural relatif marang Anthropic ing perbandingan asli.

Intine, OpenAI ujar: sampeyan ngukur model kita kanthi tangan siji diikat ing mburi.

Respon Chollet

Co-founder ARC Prize François Chollet nanggapi kanthi nggambar garis sing jelas ing antarane rong jinis persiyapan tes. Harnesses "digawe khusus kanggo ngatasi pathokan utawa sing ngemot kawruh babagan format pathokan" ora ana watesan, ujare. Nanging setelan API tujuan umum "sing ora dikembangake kanggo ARC-AGI-3 lan kasedhiya kanggo kabeh pangguna API" minangka game sing adil.

Akibaté, Chollet ngakoni manawa skor GPT-5.6 Sol ARC Prize ndadekake OpenAI dadi kerugian. Dheweke nyathet manawa organisasi kasebut duwe "akeh bolak-balik karo OpenAI babagan cara nguji model sing paling apik, utamane babagan pemadatan," lan nampani perusahaan kasebut "wiwit ngerteni jawabane."

Chollet ora menehi tandha siji keprihatinan sing isih ana. Panyedhiya sing beda-beda nggunakake setelan sing beda-beda nggawe apa sing diarani "masalah paritas potensial" - nanging dheweke nganggep manawa bisa ditampa "anggere setelan lan biaya dilaporake kanthi jelas."

Napa Iki Penting Ngluwihi Leaderboard

Babagan kasebut negesake ketegangan sing nggawe maneh kepiye industri AI ngevaluasi kemajuan. Amarga model tambah akeh disebarake liwat API sing sugih fitur tinimbang minangka sistem mandiri, garis antarane kemampuan bawaan model lan teknik ing sakubenge tetep burem. A pathokan sing nglirwakake scaffolding bisa understate kinerja nyata; siji sing nganut bisa menehi ganjaran perusahaan kanggo game test.

Debat ARC-AGI-3 ora mungkin sing pungkasan. Minangka model frontier cluster cedhak ndhuwur benchmarks ditetepake, disagreements babagan apa counts minangka ukuran adil - lan sabuk kang bakal nyetel standar - mung bakal intensify.

Tetep Ahead saka AI

Pengin ngetutake kabar AI anyar babagan model, tolok ukur, lan laboratorium sing nggawe? AI Buzz Wire wis dijamin.

Waca liyane warta AI