OpenAI merilis GPT-6.1 Sol pada tanggal 29 September, menghentikan GPT-6 Sol hanya tujuh hari setelah debut model tersebut, menurut perusahaan pembandingan independen Artificial Analysis. Pertukaran tersebut bertepatan dengan konferensi pengembang DevDay perusahaan, di mana CNET melaporkan bahwa peserta dapat segera mulai menggunakan GPT-6.1 Sol bersamaan dengan agen Dots yang baru diluncurkan dan serangkaian perubahan langganan.

Penggantian produk unggulan ke produk unggulan selama tujuh hari merupakan hal yang tidak biasa bahkan menurut standar akselerasi pada tahun 2026, dan tolok ukur menunjukkan mengapa OpenAI bergerak cepat. Untuk liputan berkelanjutan mengenai peluncuran model, pertarungan benchmark, dan perang harga yang mendasarinya, AI Buzz Wire melacak perkembangan penting yang terjadi.

Lompatan terukur dalam tujuh hari

Analisis Buatan melaporkan bahwa GPT-6.1 Sol memperoleh 4 poin pada Indeks Intelijen perusahaan dibandingkan GPT-6 Sol, dan 5 poin dibandingkan GPT-5.6 Sol, hanya 1 poin di bawah GPT-6 Astra, model OpenAI yang paling mumpuni. Evaluasi perusahaan memadukan penalaran, kerja pengetahuan, matematika, dan tugas-tugas agen ke dalam satu skor komparatif.

Sub-skor menunjukkan di mana perolehan tersebut terkonsentrasi. GPT-6.1 Sol meningkatkan 4 poin di AA-Briefcase v1.1 dan 5 poin di GDPval-AA v2.1, keduanya menguji kerja pengetahuan agen. Lompatan 12 poin pada Terminal-Bench 4.0 menunjukkan kinerja yang jauh lebih baik di lingkungan terminal nyata, sementara Ujian Terakhir Humanity naik 5 poin dan GDP.pdf naik 6 poin.

Ada satu angka yang menonjol bagi siapa pun yang menggunakan model untuk penelitian: akurasi pada AA-Omniscience meningkat 8 poin sementara tingkat halusinasi turun dari 60 persen menjadi 54 persen. Kedua angka tersebut tetap tinggi secara absolut, namun arah perjalanan penting bagi alur kerja di mana jawaban yang salah dan yakin lebih buruk daripada tidak ada jawaban.

Harga stiker sama, praktiknya lebih murah

Dalam hal harga, GPT-6.1 Sol mempertahankan kartu tarif GPT-6 Sol sebesar $2 per juta token masukan dan $10 per juta token keluaran, namun diskon pembacaan cache meningkat dari 90 persen menjadi 95 persen. Analisis Buatan mencatat bahwa harga gabungan GPT-6.1 Sol untuk beban kerja agen sedikit lebih rendah dibandingkan GPT-6 Sol, sehingga memperpanjang serangkaian pemotongan harga efektif yang dimulai ketika GPT-6 Sol diluncurkan dengan diskon 50 persen dibandingkan GPT-5.6 Sol.

Lintasan harga adalah kisah nyata di sini. Dalam kurun waktu dua rilis, OpenAI telah mengurangi separuh biaya efektif lini depan tingkat menengahnya sebanyak dua kali, sekaligus meningkatkan kualitasnya setiap saat.

Biaya per tugas: $0,72 versus $3,26

Biaya per tugas adalah kesenjangan yang mencolok dengan GPT-6 Astra. Dengan upaya maksimal, Analisis Buatan mematok GPT-6.1 Sol sebesar $0,72 per tugas Indeks Intelijen, kurang dari seperempat dari GPT-6 Astra sebesar $3,26. Dibandingkan pendahulunya, penghematannya mencapai 31 persen ($1,05 untuk GPT-6 Sol), dan dibandingkan GPT-5.6 Sol, penghematannya mencapai 64 persen ($1,99).

Menurut perusahaan tersebut, setiap tingkat upaya GPT-6.1 Sol melampaui batas efisiensi biaya Pareto — yang berarti bahwa untuk tingkat kecerdasan tertentu, tidak ada pilihan yang lebih murah di antara model yang dilacaknya. Gambaran efisiensi token lebih beragam: GPT-6.1 Sol mengonsumsi sekitar 10 hingga 30 persen lebih banyak token keluaran dibandingkan GPT-6 Sol di seluruh tingkat upaya, meskipun pengaturan upaya rendah dan menengahnya tetap optimal Pareto untuk efisiensi token setelah kecerdasan yang lebih tinggi diperhitungkan. Dalam pengkodean, model ini memperoleh 3 poin dibandingkan GPT-6 Sol pada upaya maksimal pada Indeks Agen Pengkodean perusahaan.

Mengapa penyelesaian tujuh hari itu penting

Daftar DevDay yang lebih luas memperkuat gambaran yang sama. Laporan CNET menyusun konferensi ini berdasarkan tiga hal yang dapat segera digunakan oleh pengembang — GPT-6.1 Sol, agen Dots, dan rencana berlangganan yang dikerjakan ulang — daripada pratinjau penelitian jarak jauh. Pesan yang disampaikan kepada pengembang adalah ketersediaan saat ini, bukan kemungkinan besok.

Irama unggulan ini merupakan sinyal singkat bahwa kendala kompetitif telah bergeser dari pelatihan berjalan ke penyempurnaan pasca pelatihan dan penyediaan infrastruktur. Peningkatan tingkat poin yang dikirimkan dalam seminggu lebih terlihat seperti pos pemeriksaan yang dioptimalkan dan lembar harga baru daripada model dasar dari awal, dan para pesaingnya juga berperilaku sama: Google mengumumkan Gemini 4 Argon pada tanggal 30 September, sebuah model terdepan yang pada awalnya menjangkau para pembela siber tepercaya melalui Program Fairwind dengan tarif token yang sama sebesar $2/$10 per juta.

Bagi pengembang, ada tiga hal praktis yang dapat diambil dari angka-angka yang terverifikasi. Pertama, beban kerja agen dengan penggunaan kembali cache yang besar akan langsung mendapat manfaat dari diskon cache sebesar 95 persen. Kedua, anggaran harus memodelkan konsumsi token keluaran yang lebih tinggi sebelum bermigrasi, karena harga per token tidak berubah meskipun model tersebut berpikir lebih lama. Ketiga, Astra tetap menjadi yang tertinggi dalam tugas-tugas yang poin terakhir kecerdasannya bernilai 4x lebih mahal — namun dalam kasus GPT-6.1 Sol, pada sebagian besar pekerjaan, hal tersebut tidak berlaku.

Peringatan ini patut untuk diulangi: angka-angka ini berasal dari satu evaluator independen, betapapun ketatnya metodologi yang digunakan, dan skor indeks memberikan penghargaan terhadap gabungan beban kerja tertentu. Tim dengan beban kerja yang menuntut harus menjalankan kembali evaluasi mereka sendiri sebelum mengubah rute lalu lintas produksi.

---

Tetap Terdepan dalam AI

Dapatkan berita, analisis, dan terobosan AI terkini — semuanya di satu tempat.

Baca berita AI selengkapnya →