Apa yang berubah
Menurut kad kadar terbitan OpenAI dan log perubahan API, harga per-juta-token standard kini berbunyi:
- GPT-5.6 Luna: input 20 sen dan output $1.20, turun daripada $1 dan $6 — pengurangan 80%
- GPT-5.6 Terra: $2 dan $12, turun daripada $2.50 dan $15 — potongan 20%
- GPT-5.6 Sol (utama): $5 dan $30, tidak berubah
Ketiga-tiga peringkat dilancarkan kepada ketersediaan umum pada 9 Julai 2026 pada kadar yang lebih tinggi, meletakkan harga semula hanya 21 hari dalam kehidupan komersial keluarga. Reuters dan CNBC kedua-duanya mengesahkan pemotongan, dan Axios melaporkan bahawa pengurangan paling curam jatuh pada model Luna.
Pemotongan mengalir melalui setiap peringkat perkhidmatan
Pengurangan tidak terhad kepada harga tajuk. Mereka mengalir melalui setiap pilihan pada kad kadar:
- Pemprosesan Batch dan Flex, kedua-duanya separuh daripada harga standard, meletakkan Luna pada input 10 sen dan output 60 sen bagi setiap juta token.
- Input dicache dibaca, didiskaunkan 90%, turun kepada dua sen bagi setiap juta token pada Luna dan 20 sen pada Terra.
- Permintaan konteks panjang, dibilkan pada dua kali ganda kadar input dan 1.5 kali keluaran, mendarat pada 40 sen dan $1.80 untuk Luna.
Bagi pasukan yang sudah menghalakan klasifikasi pukal, pengekstrakan atau gelung ejen yang panjang melalui peringkat yang lebih murah, panggilan yang sama kini menelan belanja yang lebih kecil daripada apa yang mereka lakukan sehari sebelumnya.
Bagaimana pemotongan dibandingkan dengan Anthropic
Pada 20 sen masuk dan $1.20 keluar, Luna kini mengurangkan model terbitan termurah Anthropic, Haiku 4.5, dengan kira-kira lima kali ganda pada input dan empat kali ganda pada output, menurut halaman harga Anthropic. Kadar baharu Terra berada di bawah $3 dan $15 yang dijadual dikenakan Claude Sonnet 5 sebaik sahaja harga pengenalannya tamat pada 31 Ogos 2026.
Di bahagian atas kedua-dua barisan, Sol masih kos pengeluaran yang lebih tinggi daripada Opus 5 Anthropic, yang berharga $5 dan $25.
Pemprosesan Keutamaan menjadi mod Pantas
Masukan changelog yang sama menghentikan "Pemprosesan Keutamaan" dan menggantikannya dengan "Mod pantas." Untuk model Sol perdana, OpenAI mengatakan mod Pantas berjalan sehingga 2.5 kali kelajuan standard pada dua kali ganda harga, dan suis serasi ke belakang — permintaan telah ditandakan untuk laluan keutamaan ke mod Pantas tanpa perubahan kod.
Kadar mod pantas ialah $10 dan $60 untuk Sol, $4 dan $24 untuk Terra, dan 40 sen dan $2.40 untuk Luna. Terutamanya, Anthropic menjual produk yang sama di bawah nama yang sama dan terma yang sama, dan kedua-dua kad kadar kini menumpu pada inferens yang disematkan wilayah juga: OpenAI mengenakan kenaikan 10% pada model yang dikeluarkan pada atau selepas 5 Mac 2026 apabila pelanggan memerlukan pemastautin data, manakala Anthropic mengebilkan inferens AS sahaja pada kadar 1.1 kali ganda daripada inferens standardnya.
Mengapa peringkat yang lebih murah menjadi lebih murah
Sehari sebelum pemotongan, OpenAI menerbitkan siaran kejuruteraan yang menerangkan pengoptimuman merentas timbunan inferensnya. Lima ahli kakitangan teknikal syarikat menulis bahawa Sol, berjalan di dalam alat pengekodan Codexnya, menulis semula kernel GPU pengeluaran — kerja OpenAI berkata mengurangkan kos penyajian hujung ke hujung sebanyak 20%. Model itu juga mereka bentuk semula model draf penyahkodan spekulatifnya sendiri merentas ratusan eksperimen, perubahan yang dikreditkan dengan meningkatkan kecekapan penjanaan token sebanyak lebih daripada 15%.
Itu adalah angka OpenAI sendiri untuk susunannya sendiri, tetapi mereka menunjukkan pada pusat kos yang sama alamat potongan harga: ejen memanfaatkan di belakang Codex dan ChatGPT. OpenAI mengehadkan output alat pada 10,000 token secara lalai dan menyimpan sejarah yang boleh dilihat model sahaja, jadi gelung ejen yang menghantar semula arahannya pada setiap langkah mencapai cache segera dan bukannya membayar kadar input penuh. Syarikat itu menutup jawatan itu dengan komitmen untuk menyampaikan "penambahbaikan di bawah hud kembali kepada pengguna kami dalam bentuk perisikan yang lebih meluas dan menjimatkan kos." Kad kadar diikuti sehari kemudian.
Rakan kongsi awan dan pengebilan
OpenAI menyatakan bahawa pembeli yang menghalakan trafik melalui Amazon Bedrock dibilkan oleh AWS, dan kadar tersebut boleh berbeza daripada kad terbitannya sendiri. Memandangkan lebih banyak perusahaan memusatkan akses model melalui vendor awan tunggal, jurang antara harga langsung OpenAI dan apa yang sebenarnya dibayar oleh pelanggan melalui pengantara akan menjadi penting seperti nombor tajuk itu sendiri.
Pasaran mengira setiap token
Pemotongan tanah kerana pembeli perusahaan mengaudit inferens membelanjakan lebih rapat berbanding sebelum ini. Awal minggu ini, pelaporan mendokumentasikan bagaimana era "tokenmaxxing" yang tidak terkawal — menolak volum tanpa kos menonton — semakin pudar apabila bil AI korporat melonjak merentasi platform utama. Keputusan OpenAI untuk menurunkan penjimatan kos dalamannya kepada pelanggan, dan bukannya menurunkan margin, adalah isyarat jelas tentang tempat ia percaya pertempuran kompetitif kini sedang diperjuangkan: bukan di sempadan, di mana Sol masih memerintahkan harga premium, tetapi pada peringkat volum tinggi yang murah di mana kebanyakan trafik pengeluaran sebenarnya hidup.
Dengan harga Sol tidak berubah, keputusan langsung untuk pembangun kekal tepat di mana OpenAI meletakkannya sejak keluarga dihantar: peringkat mana yang diperlukan oleh setiap permintaan. Perbezaannya ialah kos untuk membuat keputusan yang salah baru sahaja menurun secara mendadak.
---
Kekal Mendahului AIDapatkan berita, analisis dan penemuan terkini AI — semuanya di satu tempat.
Baca lebih banyak berita AI →