OpenAI mengeluarkan GPT-6.1 Sol pada 29 September, menamatkan GPT-6 Sol hanya tujuh hari selepas kemunculan model itu, menurut firma penanda aras bebas Analisis Buatan. Pertukaran itu bertepatan dengan persidangan pemaju DevDay syarikat, di mana CNET melaporkan bahawa peserta boleh mula menggunakan GPT-6.1 Sol serta-merta bersama ejen Dots yang baru dilancarkan dan satu set perubahan langganan.

Penggantian perdana ke perdana tujuh hari adalah luar biasa walaupun mengikut piawaian dipercepatkan 2026, dan penanda aras mencadangkan sebab OpenAI bergerak pantas. Untuk liputan berterusan pelancaran model, pertarungan penanda aras dan perang harga di bawahnya, AI Buzz Wire menjejaki perkembangan yang penting semasa ia berlaku.

Lompatan yang boleh diukur dalam tujuh hari

Analisis Buatan melaporkan bahawa GPT-6.1 Sol memperoleh 4 mata pada Indeks Perisikan firma berbanding GPT-6 Sol, dan 5 mata mengatasi GPT-5.6 Sol, mendarat hanya 1 mata di bawah GPT-6 Astra, model OpenAI yang paling berkebolehan. Penilaian firma itu menggabungkan penaakulan, kerja pengetahuan, matematik, dan tugas agen ke dalam satu skor perbandingan.

Sub-skor menunjukkan di mana keuntungan tertumpu. GPT-6.1 Sol meningkatkan 4 mata dalam AA-Briefcase v1.1 dan 5 mata dalam GDPval-AA v2.1, yang kedua-duanya menguji kerja pengetahuan agen. Lonjakan 12 mata dalam Terminal-Bench 4.0 mata kepada prestasi yang lebih baik secara material dalam persekitaran terminal sebenar, manakala Peperiksaan Terakhir Kemanusiaan meningkat 5 mata dan GDP.pdf meningkat 6.

Satu nombor menonjol bagi sesiapa sahaja yang menggunakan model untuk penyelidikan: ketepatan pada AA-Omniscience meningkat 8 mata manakala kadar halusinasi jatuh daripada 60 peratus kepada 54 peratus. Kedua-dua angka kekal tinggi dari segi mutlak, tetapi arah perjalanan penting untuk aliran kerja di mana jawapan salah yakin adalah lebih teruk daripada tiada jawapan.

Harga pelekat yang sama, lebih murah dalam amalan

Mengenai harga, GPT-6.1 Sol mengekalkan kad kadar GPT-6 Sol sebanyak $2 setiap juta token input dan $10 setiap juta token keluaran, tetapi diskaun bacaan cache meningkat daripada 90 peratus kepada 95 peratus. Analisis Buatan menyatakan bahawa harga campuran GPT-6.1 Sol untuk beban kerja agen adalah lebih rendah sedikit daripada GPT-6 Sol, memanjangkan rentetan potongan harga berkesan yang bermula apabila GPT-6 Sol dilancarkan pada diskaun 50 peratus kepada GPT-5.6 Sol.

Trajektori harga adalah kisah sebenar di sini. Dalam tempoh dua keluaran, OpenAI telah mengurangkan separuh kos efektif garis sempadan pertengahan peringkat dua kali, sambil meningkatkan kualiti setiap kali.

Kos setiap tugas: $0.72 berbanding $3.26

Kos setiap tugas adalah apabila jurang dengan GPT-6 Astra menjadi ketara. Dengan usaha maksimum, Analisis Buatan mematok GPT-6.1 Sol pada $0.72 setiap tugas Indeks Kecerdasan, kurang daripada satu perempat daripada $3.26 GPT-6 Astra. Berbanding pendahulunya sendiri, penjimatan ialah 31 peratus ($1.05 untuk GPT-6 Sol), dan berbanding GPT-5.6 Sol ia mencapai 64 peratus ($1.99).

Menurut firma itu, setiap tahap usaha GPT-6.1 Sol menolak sempadan Pareto kecekapan kos — bermakna untuk tahap kecerdasan tertentu, tiada pilihan yang lebih murah wujud dalam kalangan model yang dijejakinya. Gambaran kecekapan token lebih bercampur-campur: GPT-6.1 Sol menggunakan kira-kira 10 hingga 30 peratus lebih banyak token keluaran daripada GPT-6 Sol merentas tahap usaha, walaupun tetapan usaha rendah dan sederhananya kekal Pareto-optimum untuk kecekapan token setelah kecerdasan yang lebih tinggi diambil kira. Dalam pengekodan, model itu memperoleh 3 mata berbanding GPT-6 Sol pada usaha maksimum pada Indeks Ejen.

Mengapa pemulihan tujuh hari itu penting

Paparan DevDay yang lebih luas mengukuhkan gambaran yang sama. Laporan CNET merangka persidangan mengenai tiga perkara yang boleh digunakan oleh pembangun dengan segera — GPT-6.1 Sol, ejen Dots, dan rancangan langganan yang diolah semula — dan bukannya pratonton penyelidikan yang jauh. Mesej kepada pembangun ialah ketersediaan hari ini, bukan kemungkinan esok.

Flagship mengisyaratkan isyarat pendek ini bahawa kekangan persaingan telah beralih daripada larian latihan kepada penambahbaikan selepas latihan dan penyediaan infrastruktur. Peningkatan tahap mata yang dihantar dalam seminggu kelihatan lebih seperti pusat pemeriksaan yang dioptimumkan dan lembaran harga baharu daripada model asas dari awal, dan saingan berkelakuan dengan cara yang sama: Google mengumumkan Gemini 4 Argon pada 30 September, model sempadan yang pada mulanya menjangkau pembela siber yang dipercayai melalui Program Fairwindnya pada kadar token $2/$10 setiap juta yang sama.

Bagi pembangun, tiga pengambilan praktikal mengikut nombor yang disahkan. Pertama, beban kerja ejen dengan penggunaan semula cache yang berat mendapat manfaat serta-merta daripada diskaun cache 95 peratus. Kedua, belanjawan harus memodelkan penggunaan token keluaran yang lebih tinggi sebelum berhijrah, kerana harga per-token tidak berubah walaupun model berfikir lebih lama. Ketiga, Astra kekal sebagai siling untuk tugasan di mana titik risikan terakhir bernilai premium kos 4x — Kes GPT-6.1 Sol ialah untuk kebanyakan kerja, ia tidak.

Kaveat yang patut diulang: angka ini datang daripada penilai bebas tunggal, walau bagaimanapun ketat metodologinya, dan skor indeks memberi ganjaran kepada campuran beban kerja tertentu. Pasukan dengan beban kerja yang mencabar harus menjalankan semula penilaian mereka sendiri sebelum mengubah hala trafik pengeluaran.

---

Kekal Mendahului AI

Dapatkan berita, analisis dan penemuan terkini AI — semuanya di satu tempat.

Baca lebih banyak berita AI →