OpenAI menolak semula selepas Claude Opus 5 Anthropic mendominasi penanda aras ARC-AGI-3, menerbitkan hasil yang menunjukkan model GPT-5.6 Sol sendiri mencapai 38.3 peratus — dengan syarat anda menggunakan tetapan pilihan OpenAI dan bukannya abah-abah ujian rasmi.

Pertikaian itu, yang berlaku pada 30 Julai 2026, menyebabkan masalah yang semakin meningkat dalam penilaian AI: penanda aras tidak lagi mengukur hanya model, tetapi keseluruhan perancah teknikal yang membalutinya. Untuk analisis yang lebih mendalam tentang perkembangan AI terkini dan keluaran model, AI Buzz Wire sedang menjejaki cerita itu.

Nombor dan Tangkapan

OpenAI melaporkan bahawa GPT-5.6 Sol mencapai 38.3 peratus pada ARC-AGI-3, mengatasi Claude Opus 5 milik Anthropic, yang memperoleh 30.2 peratus selepas sebelum ini melipatgandakan rekod penanda aras. Kaveat itu penting: angka 38.3 peratus itu bergantung pada dua ciri khusus API Respons OpenAI.

Yang pertama ialah Retained Reasoning, yang mengekalkan rantaian pemikiran model antara langkah dan bukannya membuangnya selepas setiap tindakan. Yang kedua ialah Compaction, yang meringkaskan konteks lama dan bukannya memotongnya, membenarkan model untuk terus menyelesaikan masalah yang lama tanpa kehilangan alasan awal.

Jalankan melalui abah-abah piawai rasmi ARC Prize — yang dengan sengaja mengelakkan tetapan khusus pembekal untuk memastikan perbandingan epal-ke-epal — GPT-5.6 Sol berjaya hanya 7.8 peratus. Sebabnya, kata OpenAI, adalah bahawa persediaan rasmi membuang alasan model selepas setiap langkah, mengurangkan prestasi pada tugas yang memerlukan pemikiran berbilang langkah yang berterusan.

Penanda Aras Dibina untuk Kesucian

ARC-AGI-3 telah direka oleh François Chollet dan pasukan Hadiah ARC untuk menyiasat keupayaan model untuk menyelesaikan teka-teki penaakulan novel yang tidak pernah dilihat sebelum ini — ujian kecerdasan am dan bukannya pengetahuan yang dihafal. Untuk memastikan perbandingan adil, abah-abah rasmi sengaja menanggalkan ciri khusus pembekal, mengukur keupayaan model mentah dalam persekitaran neutral.

Hujah balas OpenAI ialah berkecuali ini boleh menjadi kecacatan. Syarikat itu berpendapat bahawa abah-abah rasmi bergantung pada "API penyiapan gaya OpenAI" yang lebih lama yang tidak mempunyai keupayaan yang telah ditawarkan oleh Claude API, dengan berkesan meletakkan OpenAI pada kelemahan struktur berbanding Anthropic dalam perbandingan asal.

Pada dasarnya, OpenAI berkata: anda mengukur model kami dengan satu tangan diikat di belakangnya.

Respon Chollet

Pengasas bersama ARC Prize François Chollet bertindak balas dengan membuat garis yang jelas antara dua jenis persediaan ujian. Memanfaatkan "dibuat khas untuk menyelesaikan penanda aras atau yang mengandungi pengetahuan tentang format penanda aras" adalah terlarang, katanya. Tetapi tetapan API tujuan umum "yang tidak dibangunkan untuk ARC-AGI-3 dan yang tersedia untuk semua pengguna API" adalah permainan yang adil.

Sebenarnya, Chollet mengakui bahawa skor GPT-5.6 Sol ARC Prize sendiri meletakkan OpenAI pada kedudukan yang lemah. Beliau menyatakan bahawa organisasi itu telah "banyak berulang-alik dengan OpenAI tentang cara terbaik untuk menguji model mereka, terutamanya berkaitan pemadatan," dan mengalu-alukan syarikat itu "mula memikirkan jawapannya."

Chollet telah membenderakan satu kebimbangan yang masih ada. Pembekal yang berbeza menggunakan tetapan berbeza mencipta apa yang dipanggilnya "isu pariti yang berpotensi" — tetapi dia menganggap itu boleh diterima "selagi tetapan dan kosnya dilaporkan dengan jelas."

Mengapa Ini Penting Melangkaui Papan Pendahulu

Episod ini menekankan ketegangan yang membentuk semula cara industri AI menilai kemajuan. Memandangkan model semakin banyak digunakan melalui API yang kaya dengan ciri dan bukannya sebagai sistem kendiri, garis antara keupayaan sedia ada model dan kejuruteraan di sekelilingnya terus kabur. Penanda aras yang mengabaikan perancah mungkin merendahkan prestasi dunia sebenar; yang menerimanya mungkin memberi ganjaran kepada syarikat untuk bermain ujian.

Perbahasan ARC-AGI-3 tidak mungkin menjadi yang terakhir. Memandangkan model sempadan berkelompok berhampiran bahagian atas penanda aras yang telah ditetapkan, perselisihan pendapat mengenai perkara yang dianggap sebagai ukuran yang adil — dan abah-abah mana yang dapat menetapkan piawaian — hanya akan bertambah hebat.

Kekal Mendahului AI

Mahu mengikuti berita terbaharu AI tentang model, penanda aras dan makmal yang membinanya? AI Buzz Wire membantu anda.

Baca lebih banyak berita AI