xAI đã phát hành Grok 4.7, mô hình có khả năng nhất của công ty về mã hóa và công việc tri thức cho đến nay, sau nhiều tuần bị công chúng trêu chọc và ít nhất một lần trì hoãn. Được công bố trên trang web của công ty vào Chủ Nhật, mô hình này có cùng mức giá và tốc độ phục vụ như phiên bản tiền nhiệm Grok 4.6: 2 USD trên một triệu token đầu vào và 6 USD trên một triệu token đầu ra, gần bằng một nửa giá niêm yết của GPT-5.6 Sol Max của OpenAI ($ 4/$ 20) và thấp hơn nhiều so với Fable 5.1 Max của Anthropic ($10/$50).

Để biết tin tức và phân tích mới nhất về AI, hãy truy cập AI Buzz Wire.

Mô hình cơ sở lớn hơn, được huấn luyện cho các nhiệm vụ dài

Theo thông báo của xAI, Grok 4.7 sử dụng mô hình cơ sở mới, lớn hơn so với Grok 4.6 và được đào tạo với quá trình học tăng cường dài hơn để thực hiện nhiều nhiệm vụ phức tạp hơn, tập trung vào các vấn đề mất nhiều giờ để hoàn thành. Công ty cho biết mô hình này xác minh công việc của chính họ tốt hơn và quản lý bối cảnh dài hơn, đồng thời mô hình này được đào tạo để hiểu rõ về cách khai thác Grok Bot, cải thiện các nhiệm vụ đàm thoại và công việc kiến ​​thức chung.

Việc phát hành diễn ra sau một thời gian ồn ào. Elon Musk lần đầu tiên cho biết vào đầu tháng 9 rằng Grok 4.7 sẽ hạ cánh trong vòng mười ngày, sau đó thừa nhận vào giữa tháng 9 rằng mô hình này cần thêm vài ngày để hoàn thiện, theo TeslaNorth.com. Nó hiện đang được vận chuyển và GitHub đã xác nhận cùng ngày rằng Grok 4.7 có sẵn trong GitHub Copilot.

Hình Benchmark: Mạnh, Không Quét

Dữ liệu điểm chuẩn do xAI công bố cho thấy một mô hình dẫn đầu trong một số danh mục dài hạn trong khi vẫn xếp sau cấu hình đắt nhất của Anthropic trên các danh mục khác:

  • CursorBench 4.0, nhấn mạnh vào các tác vụ mã hóa chạy dài hơn: Grok 4.7 đạt 46,3%, dẫn trước GPT-5.6 Sol Max (41,7%) và Grok 4.6 High (40,4%), nhưng xếp sau Fable 5.1 Max (51,8%).
  • Terminal-Bench 4.0, thiết bị đầu cuối làm việc nhiều giờ: 38,0%, tăng mạnh từ 20,3% của Grok 4.6 và chỉ trước GPT-5.6 Sol Max (37,3%), mặc dù Fable 5.1 Max dẫn đầu ở mức 57,9%.
  • EEBench, điểm chuẩn kỹ thuật điện: 64,0%, một bước nhảy vọt so với 53,0% của Grok 4.6 và là mức cao nhất trong số các mô hình được liệt kê.
  • DeepSWE v1.1: 71,0% khi nỗ lực cao, so với 65,2% đối với Grok 4,6 và 72,7% đối với GPT-5.6 Sol Max.
  • AA Briefcase v1.1, văn phòng làm việc nhiều giờ: 1.657, tăng từ 1.546 và xếp sau Fable 5.1 Max ở mức 1.678.
  • Điểm chuẩn của Đại lý pháp lý Harvey: 19,6%, cao hơn Grok 4,6 (15,8%) và vượt xa GPT-5.6 Sol Max (2,5%) và Fable 5.1 Max (6,7%) về thước đo này.
  • HealthBench Professional: 56,7%, cải thiện so với 48,5% của Grok 4.6 nhưng xếp sau GPT-5.6 Sol Max (60,5%) và Fable 5.1 Max (62,1%).

Trên GDPval, một điểm chuẩn công việc tri thức chuyên nghiệp do Elo chấm điểm, biểu đồ của xAI đặt Grok 4,7 ở mức lý luận xhigh trên 1.695 - tăng từ 1.605 của Grok 4.6, xếp sau Fable 5.1 Max (1.735) và trước GPT-6 Astra Max (1.542).

Giá là câu chuyện

Tuyên bố tích cực nhất trong thông báo là về kinh tế hơn là kỹ thuật: xAI mô tả Grok 4.7 nhanh gấp đôi với mức giá chỉ bằng một nửa so với các mẫu tương đương và bảng giá được công bố ủng hộ sự so sánh tiêu đề với cấu hình hàng đầu của hai đối thủ chính của nó. Giá mã thông báo $2/$6 của Grok 4.7 không thay đổi so với Grok 4.6, có nghĩa là người mua nhận được cải tiến qua từng thế hệ mà không cần tăng giá.

Định vị đó mở rộng chiến lược mà xAI đã theo đuổi trên dòng Grok 4.x: phù hợp hoặc tiếp cận chất lượng vượt trội trong khi giảm mức giá cao cấp của OpenAI và Anthropic, sau đó phân phối mạnh mẽ thông qua các đối tác bao gồm GitHub, Cursor và OpenRouter.

Xem gì

Cảnh báo trung thực là xAI đã tự xuất bản biểu đồ so sánh và việc xác minh độc lập từ các nhà tổng hợp điểm chuẩn sẽ mất nhiều ngày. Theo những con số mà xAI chọn nêu bật, Grok 4.7 là một bước tiến thực sự so với Grok 4.6 — rõ ràng nhất là trên Terminal-Bench 4.0 và EEBench — nhưng nó không vượt qua Fable 5.1 Max, vốn vẫn dẫn đầu về điểm chuẩn mã hóa và sức khỏe trong khi chi phí cho mỗi mã thông báo đầu ra cao hơn gấp 5 lần.

Đối với các nhà phát triển chạy khối lượng công việc tổng đài kéo dài nhiều giờ, phép tính giá-hiệu suất có thể quan trọng hơn vị trí thô trên bảng xếp hạng. Grok 4.7 hiện có sẵn thông qua API của xAI và trong GitHub Copilot.

Đi trước AI

Để liên tục đưa tin về những bước phát triển quan trọng nhất của ngành AI, hãy đánh dấu trang AI Buzz Wire và không bao giờ bỏ lỡ tin tức nóng hổi nào.

Đọc thêm tin tức về AI