Apa yang berubah
Menurut kartu tarif yang diterbitkan OpenAI dan log perubahan API, harga standar per juta token sekarang berbunyi:
- GPT-5.6 Luna: masukan 20 sen dan keluaran $1,20, turun dari $1 dan $6 — pengurangan sebesar 80%
- GPT-5.6 Terra: $2 dan $12, turun dari $2,50 dan $15 — potongan 20%
- GPT-5.6 Sol (unggulan): $5 dan $30, tidak berubah
Ketiga tingkatan tersebut diluncurkan ke ketersediaan umum pada tanggal 9 Juli 2026 dengan harga yang lebih tinggi, sehingga penyesuaian harga hanya terjadi dalam 21 hari setelah kehidupan komersial keluarga tersebut. Reuters dan CNBC mengonfirmasi pemotongan tersebut, dan Axios melaporkan bahwa penurunan paling tajam terjadi pada model Luna.
Pemotongan mengalir melalui setiap tingkat layanan
Pengurangan ini tidak terbatas pada harga headline saja. Mereka mengalir melalui setiap opsi pada kartu tarif:
- Pemrosesan batch dan Flex, keduanya setengah harga standar, memberi Luna input 10 sen dan output 60 sen per juta token.
- Pembacaan masukan dalam cache, diskon 90%, turun menjadi dua sen per juta token di Luna dan 20 sen di Terra.
- Permintaan konteks panjang, ditagih dua kali lipat tarif input dan 1,5 kali output, mendapatkan harga 40 sen dan $1,80 untuk Luna.
Untuk tim yang sudah merutekan klasifikasi massal, ekstraksi, atau loop agen panjang melalui tingkat yang lebih murah, panggilan yang sama kini memerlukan biaya yang lebih kecil dibandingkan biaya yang mereka lakukan sehari sebelumnya.
Bagaimana pemotongannya dibandingkan dengan Anthropic
Dengan harga masuk 20 sen dan $1,20 keluar, Luna sekarang mengalahkan model termurah Anthropic yang diterbitkan, Haiku 4.5, sekitar lima kali lipat pada masukan dan empat kali lipat pada keluaran, menurut halaman harga Anthropic. Tarif baru Terra berada di bawah $3 dan $15 yang dijadwalkan akan dikenakan oleh Claude Sonnet 5 setelah harga perkenalannya berakhir pada 31 Agustus 2026.
Di bagian atas kedua jajaran, Sol masih memiliki harga produksi yang lebih mahal daripada Opus 5 Anthropic, yang dihargai $5 dan $25.
Pemrosesan Prioritas menjadi mode Cepat
Entri changelog yang sama menghentikan "Pemrosesan Prioritas" dan menggantinya dengan "Mode cepat". Untuk model Sol andalan, OpenAI mengatakan mode Cepat berjalan hingga 2,5 kali kecepatan standar dengan harga dua kali lipat, dan sakelar ini kompatibel – permintaan sudah ditandai untuk rute prioritas ke mode Cepat tanpa perubahan kode.
Tarif mode cepat adalah $10 dan $60 untuk Sol, $4 dan $24 untuk Terra, dan 40 sen dan $2,40 untuk Luna. Khususnya, Anthropic menjual produk yang sama dengan nama dan ketentuan yang sama, dan kedua kartu tarif kini juga menyatu pada inferensi yang dipasang di wilayah: OpenAI membebankan kenaikan sebesar 10% pada model yang dirilis pada atau setelah tanggal 5 Maret 2026 ketika pelanggan memerlukan residensi data, sementara Anthropic menagih inferensi khusus AS sebesar 1,1 kali tarif standarnya.
Mengapa tingkatan yang lebih murah menjadi lebih murah
Sehari sebelum pemotongan, OpenAI menerbitkan postingan teknik yang menjelaskan pengoptimalan di seluruh tumpukan inferensinya. Lima anggota staf teknis perusahaan menulis bahwa Sol, yang menjalankan alat pengkodean Codex, menulis ulang kernel GPU produksi — pekerjaan yang menurut OpenAI memangkas biaya penyajian end-to-end sebesar 20%. Model ini juga mendesain ulang rancangan model penguraian kode spekulatifnya sendiri di ratusan eksperimen, sebuah perubahan yang dianggap meningkatkan efisiensi pembuatan token lebih dari 15%.
Itu adalah angka OpenAI sendiri untuk tumpukannya sendiri, tetapi angka tersebut menunjuk pada pusat biaya yang sama dengan alamat pemotongan harga: agen yang memanfaatkan di belakang Codex dan ChatGPT. OpenAI membatasi output alat pada 10.000 token secara default dan hanya menambahkan riwayat yang terlihat pada model, sehingga loop agen yang mengirimkan ulang instruksinya pada setiap langkah akan masuk ke cache prompt alih-alih membayar tarif input penuh. Perusahaan menutup postingannya dengan komitmen untuk memberikan "perbaikan tersembunyi kepada pengguna kami dalam bentuk intelijen yang tersedia lebih luas dan hemat biaya." Kartu tarif menyusul sehari kemudian.
Mitra cloud dan penagihan
OpenAI mencatat bahwa pembeli yang merutekan lalu lintas melalui Amazon Bedrock ditagih oleh AWS, dan tarif tersebut dapat berbeda dari kartu yang diterbitkannya. Karena semakin banyak perusahaan yang memusatkan akses model melalui satu vendor cloud, kesenjangan antara harga langsung OpenAI dan jumlah yang sebenarnya dibayar pelanggan melalui perantara akan menjadi hal yang sangat penting dibandingkan dengan angka utama itu sendiri.
Pasar menghitung setiap token
Pemotongan ini terjadi karena pembeli perusahaan melakukan audit inferensi dengan belanja lebih ketat dari sebelumnya. Awal minggu ini, laporan mendokumentasikan bagaimana era “tokenmaxxing” yang tidak terkendali – mendorong volume tanpa memperhatikan biaya – memudar seiring melonjaknya tagihan AI perusahaan di seluruh platform utama. Keputusan OpenAI untuk membebankan penghematan biaya internal kepada pelanggan, dan bukan menghemat margin, merupakan sinyal jelas mengenai keyakinan mereka bahwa persaingan kini sedang berlangsung: bukan di lini depan, di mana Sol masih memberikan harga premium, namun pada tingkatan yang murah dan bervolume tinggi, tempat sebagian besar lalu lintas produksi berada.
Dengan harga Sol yang tidak berubah, keputusan langsung bagi pengembang tetap sesuai dengan yang ditetapkan OpenAI sejak keluarga tersebut dikirimkan: tingkat mana yang dibutuhkan setiap permintaan. Perbedaannya adalah kerugian akibat kesalahan pengambilan keputusan telah menurun drastis.
---
Tetap Terdepan dalam AIDapatkan berita, analisis, dan terobosan AI terkini — semuanya di satu tempat.
Baca berita AI selengkapnya →