xAI telah mengeluarkan Grok 4.7, model syarikat yang paling berkebolehan untuk kerja pengekodan dan pengetahuan setakat ini, selepas berminggu-minggu mengusik awam dan sekurang-kurangnya satu kelewatan. Diumumkan di tapak syarikat pada hari Ahad, model itu mendarat pada harga dan kelajuan penyajian yang sama seperti pendahulunya Grok 4.6: token input $2 setiap juta dan token keluaran $6 setiap juta, kira-kira separuh daripada harga senarai OpenAI GPT-5.6 Sol Max ($4/$20) dan jauh di bawah Anthropic's Fable 5.50 ($10/$150 Max).
Untuk berita terkini dan analisis AI, lawati AI Buzz Wire.
Model Asas yang Lebih Besar, Dilatih untuk Tugas Panjang
Menurut pengumuman xAI, Grok 4.7 menggunakan model asas baharu yang lebih besar berbanding dengan Grok 4.6 dan dilatih dengan pembelajaran pengukuhan yang lebih lama dijalankan pada gabungan tugas yang lebih sukar, berwajaran kepada masalah yang mengambil masa berjam-jam untuk diselesaikan. Syarikat itu berkata model itu lebih baik dalam mengesahkan kerjanya sendiri dan mengurus konteks yang lebih panjang, dan ia dilatih untuk memahami abah-abah Grok Bot secara asli, meningkatkan tugas perbualan dan kerja pengetahuan am.
Keluaran itu mengikuti larian yang bising. Elon Musk mula-mula berkata pada awal September bahawa Grok 4.7 akan mendarat dalam masa sepuluh hari, kemudian mengakui pada pertengahan September bahawa model itu memerlukan beberapa hari lagi untuk penyempurnaan, menurut TeslaNorth.com. Ia kini dihantar, dan GitHub mengesahkan pada hari yang sama bahawa Grok 4.7 tersedia dalam GitHub Copilot.
Gambar Penanda Aras: Kuat, Tidak Menyapu
Data penanda aras yang diterbitkan oleh xAI menunjukkan model yang mendahului dalam beberapa kategori ufuk panjang sambil kekal di belakang konfigurasi paling mahal Anthropic pada yang lain:
- CursorBench 4.0, yang menekankan tugas pengekodan berjalan lebih lama: Grok 4.7 mendapat markah 46.3%, mendahului GPT-5.6 Sol Max (41.7%) dan Grok 4.6 Tinggi (40.4%), tetapi di belakang Fable 5.1 Max (51.8%).
- Terminal-Bench 4.0, kerja terminal berbilang jam: 38.0%, naik mendadak daripada 20.3% untuk Grok 4.6 dan tepat mendahului GPT-5.6 Sol Max (37.3%), walaupun Fable 5.1 Max mendahului 57.9%.
- EEBench, penanda aras kejuruteraan elektrik: 64.0%, lonjakan besar daripada 53.0% Grok 4.6 dan model tertinggi yang disenaraikan.
- DeepSWE v1.1: 71.0% pada usaha tinggi, berbanding 65.2% untuk Grok 4.6 dan 72.7% untuk GPT-5.6 Sol Max.
- AA Briefcase v1.1, kerja pejabat berbilang jam: 1,657, naik daripada 1,546, dan hampir di belakang Fable 5.1 Max pada 1,678.
- Penanda Aras Ejen Undang-undang Harvey: 19.6%, mendahului Grok 4.6 (15.8%) dan jauh mendahului GPT-5.6 Sol Max (2.5%) dan Fable 5.1 Max (6.7%) pada ukuran ini.
- HealthBench Professional: 56.7%, bertambah baik pada 48.5% Grok 4.6 tetapi mengekori GPT-5.6 Sol Max (60.5%) dan Fable 5.1 Max (62.1%).
Pada GDPval, penanda aras kerja pengetahuan profesional yang dijaringkan oleh Elo, carta xAI meletakkan Grok 4.7 pada penaakulan xhigh pada 1,695 — naik daripada 1,605 untuk Grok 4.6, di belakang Fable 5.1 Max (1,735) dan mendahului GPT-6 Astra Max (1,542).
Harga Adalah Kisahnya
Tuntutan paling agresif dalam pengumuman itu adalah ekonomi dan bukannya teknikal: xAI menggambarkan Grok 4.7 sebagai dua kali lebih pantas pada separuh harga model setanding, dan jadual harga yang diterbitkan menyokong perbandingan tajuk berbanding konfigurasi peringkat teratas dua pesaing utamanya. Harga token $2/$6 Grok 4.7 tidak berubah daripada Grok 4.6, bermakna pembeli mendapat peningkatan generasi demi generasi tanpa kenaikan harga.
Kedudukan itu memanjangkan strategi yang telah dijalankan oleh xAI merentasi barisan Grok 4.x: padan atau mendekati kualiti sempadan sambil mengurangkan peringkat harga premium OpenAI dan Anthropic, kemudian mengedarkan secara agresif melalui rakan kongsi termasuk GitHub, Kursor dan OpenRouter.
Perkara yang Perlu Dilihat
Kaveat yang jujur ialah xAI menerbitkan carta perbandingan itu sendiri, dan pengesahan bebas daripada agregator penanda aras akan mengambil masa beberapa hari. Mengenai nombor yang xAI pilih untuk diserlahkan, Grok 4.7 ialah peningkatan tulen daripada Grok 4.6 — paling ketara pada Terminal-Bench 4.0 dan EEBench — tetapi ia tidak mengatasi Fable 5.1 Max, yang mengekalkan peneraju dalam pengekodan dan penanda aras kesihatan sambil menelan kos lima kali lebih tinggi bagi setiap token keluaran.
Bagi pembangun yang menjalankan beban kerja ejen berbilang jam yang panjang, matematik prestasi harga mungkin lebih penting daripada kedudukan papan pendahulu mentah. Grok 4.7 kini tersedia melalui API xAI dan dalam GitHub Copilot.
Kekal Mendahului AI
Untuk liputan berterusan mengenai perkembangan industri AI yang paling penting, tandai halaman AI Buzz Wire dan jangan pernah terlepas kisah penting.
Baca lebih banyak berita AI