xAI telah merilis Grok 4.7, model perusahaan yang paling mumpuni untuk pekerjaan pengkodean dan pengetahuan hingga saat ini, setelah berminggu-minggu digoda publik dan setidaknya satu kali penundaan. Diumumkan di situs perusahaan pada hari Minggu, model ini hadir dengan harga dan kecepatan layanan yang sama dengan pendahulunya Grok 4.6: $2 per juta token masukan dan $6 per juta token keluaran, kira-kira setengah dari harga daftar GPT-5.6 Sol Max OpenAI ($4/$20) dan jauh di bawah Fable 5.1 Max Anthropic ($10/$50).

Untuk berita dan analisis AI terkini, kunjungi AI Buzz Wire.

Model Dasar Lebih Besar, Dilatih untuk Tugas Panjang

Menurut pengumuman xAI, Grok 4.7 menggunakan model dasar baru yang lebih besar dibandingkan dengan Grok 4.6 dan dilatih dengan pembelajaran penguatan yang lebih lama yang dijalankan pada campuran tugas yang lebih sulit, dengan bobot pada masalah yang membutuhkan waktu berjam-jam untuk diselesaikan. Perusahaan tersebut mengatakan bahwa model tersebut lebih baik dalam memverifikasi pekerjaannya sendiri dan mengelola konteks yang lebih panjang, dan bahwa model tersebut dilatih untuk memahami penggunaan Grok Bot secara asli, meningkatkan tugas percakapan dan pekerjaan pengetahuan umum.

Rilisan ini mengikuti perkembangan yang bising. Elon Musk pertama kali mengatakan pada awal September bahwa Grok 4.7 akan mendarat dalam waktu sepuluh hari, kemudian mengakui pada pertengahan September bahwa model tersebut memerlukan beberapa hari lagi penyempurnaan, menurut TeslaNorth.com. Sekarang sudah dikirimkan, dan GitHub mengonfirmasi pada hari yang sama ketika Grok 4.7 tersedia di GitHub Copilot.

Gambaran Patokan : Kuat, Tidak Menyapu

Data benchmark yang dipublikasikan oleh xAI menunjukkan model yang memimpin dalam beberapa kategori jangka panjang namun tetap berada di belakang konfigurasi Anthropic yang paling mahal dibandingkan model lainnya:

  • CursorBench 4.0, yang menekankan tugas pengkodean yang berjalan lebih lama: Grok 4.7 mendapat skor 46,3%, mengungguli GPT-5.6 Sol Max (41,7%) dan Grok 4.6 High (40,4%), namun tertinggal dari Fable 5.1 Max (51,8%).
  • Terminal-Bench 4.0, pekerjaan terminal multi-jam: 38,0%, naik tajam dari 20,3% untuk Grok 4.6 dan tepat di depan GPT-5.6 Sol Max (37,3%), meskipun Fable 5.1 Max memimpin dengan 57,9%.
  • EEBench, tolok ukur teknik kelistrikan: 64,0%, lompatan besar dari Grok 4.6 sebesar 53,0% dan tertinggi dari model yang terdaftar.
  • DeepSWE v1.1: 71,0% pada upaya tinggi, dibandingkan 65,2% untuk Grok 4.6 dan 72,7% untuk GPT-5.6 Sol Max.
  • AA Briefcase v1.1, pekerjaan kantor multi-jam: 1.657, naik dari 1.546, dan berada di belakang Fable 5.1 Max di 1.678.
  • Tolok Ukur Agen Hukum Harvey: 19,6%, mengungguli Grok 4,6 (15,8%) dan jauh melampaui GPT-5.6 Sol Max (2,5%) dan Fable 5.1 Max (6,7%) dalam ukuran ini.
  • HealthBench Professional: 56,7%, meningkat dari Grok 4.6 sebesar 48,5% tetapi tertinggal dari GPT-5.6 Sol Max (60,5%) dan Fable 5.1 Max (62,1%).

Pada GDPval, tolok ukur pekerjaan pengetahuan profesional yang dinilai oleh Elo, bagan xAI menempatkan Grok 4.7 pada xhigh Reasoning pada 1.695 — naik dari 1.605 untuk Grok 4.6, di belakang Fable 5.1 Max (1.735) dan di atas GPT-6 Astra Max (1.542).

Harga Adalah Ceritanya

Klaim yang paling agresif dalam pengumuman ini lebih bersifat ekonomis dibandingkan teknis: xAI menggambarkan Grok 4.7 dua kali lebih cepat dengan setengah harga model serupa, dan tabel harga yang dipublikasikan mendukung perbandingan utama terhadap konfigurasi tingkat atas dari dua pesaing utamanya. Harga token Grok 4.7 $2/$6 tidak berubah dari Grok 4.6, yang berarti pembeli mendapatkan peningkatan dari generasi ke generasi tanpa kenaikan harga.

Penentuan posisi tersebut memperluas strategi yang telah dilakukan xAI di seluruh lini Grok 4.x: mencocokkan atau mendekati kualitas terdepan sambil meremehkan tingkat harga premium OpenAI dan Anthropic, kemudian mendistribusikan secara agresif melalui mitra termasuk GitHub, Cursor, dan OpenRouter.

Yang Perlu Ditonton

Peringatan jujurnya adalah xAI menerbitkan bagan perbandingan itu sendiri, dan verifikasi independen dari agregator pembandingan akan memakan waktu berhari-hari. Pada nomor yang dipilih xAI untuk disoroti, Grok 4.7 merupakan peningkatan nyata dari Grok 4.6 — paling terlihat di Terminal-Bench 4.0 dan EEBench — namun tidak menyapu Fable 5.1 Max, yang tetap memimpin dalam pengkodean dan tolok ukur kesehatan dengan biaya lima kali lebih banyak per token keluaran.

Bagi pengembang yang menjalankan beban kerja agen yang panjang dan multi-jam, perhitungan harga-kinerja mungkin lebih penting daripada posisi mentah di papan peringkat. Grok 4.7 sekarang tersedia melalui API xAI dan di GitHub Copilot.

Tetap Terdepan dalam AI

Untuk liputan berkelanjutan mengenai perkembangan paling penting dalam industri AI, tandai AI Buzz Wire dan jangan pernah melewatkan berita terkini.

Baca berita AI selengkapnya