xAI đã phát hành Grok 4.6, phiên bản mới nhất của mô hình ngôn ngữ lớn biên giới, đạt 61 điểm trên Chỉ số Trí tuệ Phân tích Nhân tạo để phù hợp với GPT-5.6 Sol của OpenAI. Mô hình này ra mắt hôm nay và có sẵn ngay trong Cursor và Grok Build, với quyền truy cập API và tích hợp đối tác thông qua OpenRouter, Vercel và Cloudflare.
Để biết tin tức và phân tích mới nhất về AI, hãy truy cập AI Buzz Wire.
Trí tuệ biên giới với một phần chi phí
Theo Phân tích nhân tạo, một nền tảng đo điểm chuẩn độc lập, Grok 4.6 tăng 5 điểm so với Grok 4.5 tiền nhiệm về Chỉ số thông minh, đưa xAI trở lại cấp cao nhất cùng với OpenAI. Người mẫu này chỉ xếp sau Claude Opus 5 (63) và Claude Fable 5 (62) của Anthropic và trước Kimi K3.
Điều khiến Grok 4.6 đặc biệt đáng chú ý là giá cả của nó. Giá tiêu đề không thay đổi so với Grok 4.5 ở mức 2 đô la trên một triệu mã thông báo đầu vào và 6 đô la trên một triệu mã thông báo đầu ra. Điều đó khiến nó thấp hơn Claude Opus 5 ($5/$25) và GPT-5.6 Sol ($5/$30) hơn 60%. Chi phí đo được cho mỗi nhiệm vụ là 0,84 USD, đặt nó trên đường giới hạn Pareto thông minh so với chi phí.
Việc giữ giá cố định trong suốt một thế hệ là điều không bình thường ở các nước tiên phong, nơi mà sự thu thập thông tin thường đi kèm với việc tăng giá. Grok 4.6 mang lại mức tăng Chỉ số Thông minh năm điểm với mức giá không đổi.
Được xây dựng cho các đại lý hoạt động lâu dài
Grok 4.6 được xây dựng trên Grok 4.5 với những gì xAI mô tả là tập trung đặc biệt vào các tác nhân hoạt động lâu dài cũng như công việc trực quan và tương tác đầy tham vọng hơn. Công ty cho biết mô hình này đáp ứng các nhiệm vụ phức tạp qua nhiều bước, cho dù nghiên cứu một chủ đề, phân tích thông tin, làm việc trên cơ sở mã hay biến ý tưởng thành một ứng dụng hoàn thiện.
Điểm chuẩn tác nhân kể một câu chuyện hấp dẫn. Trên GDPval-AA v2, thước đo hàng đầu về công việc tri thức tác nhân trong thế giới thực, Grok 4.6 đạt Elo là 1753, chỉ sau Claude Opus 5 và ngang bằng về mặt thống kê với Claude Fable 5 và Qwen3.8 Max. Nó đạt 50,7% trên điểm chuẩn Ngân hàng tau-cubed cho dịch vụ khách hàng nhiều lượt, đưa nó vào top hai cùng với Qwen3.8 Max.
Trên CursorBench v3.2, Grok 4.6 đạt 69,9%, cao hơn cả GPT-5.6 Sol (67,2%) và Grok 4,5 (66,7%). Nó đăng 65,9% trên DeepSWE v1.1 và 61,3% trên FrontierCode v1.1 Extended.
Hiệu suất rẽ đáng chú ý
Một trong những phát hiện nổi bật từ Phân tích nhân tạo là hồ sơ hiệu quả của Grok 4.6 trên AA-Briefcase, một chuẩn mực riêng về các nhiệm vụ công việc tri thức tác nhân có tầm nhìn dài hạn. Mô hình này ra mắt với Elo là 1577, xếp nó ở cấp Fable 5.
Những con số hiệu quả thật đáng kinh ngạc. Grok 4.6 giải quyết trung bình các nhiệm vụ trong khoảng 53 lượt và 0,5 tỷ mã thông báo đầu vào, so với khoảng 103 lượt và 2,0 tỷ mã thông báo đầu vào cho Claude Opus 5 max. Vì công việc tác nhân có tầm nhìn dài sẽ tích lũy bối cảnh một cách nhanh chóng, nên một mô hình đạt được câu trả lời tương đương trong một nửa lượt và một phần tư số mã thông báo đầu vào sẽ có lợi thế về chi phí vượt xa việc định giá trên mỗi mã thông báo.
Đào tạo và An toàn
Grok 4.6 đã trải qua quá trình đào tạo bổ sung dài hơn Grok 4.5, với dữ liệu do mô hình tạo được tuyển chọn dành cho các khái niệm lý luận và kỹ thuật nâng cao, dữ liệu kỹ thuật chất lượng cao cũng như công thức đào tạo và tối ưu hóa được cải tiến. xAI đã sử dụng Grok 4.5 để tái tạo quỹ đạo SFT qua các nỗ lực lý luận, khai thác tác nhân và các lĩnh vực bao gồm STEM, công nghệ phần mềm và công việc tri thức.
Mô hình này mang cửa sổ ngữ cảnh 500.000 mã thông báo, không thay đổi so với Grok 4.5. xAI báo cáo rằng Grok 4.6 đã trải qua đợt thử nghiệm trước khi triển khai rộng rãi nhất từ trước đến nay về khả năng và hiệu chỉnh biện pháp bảo vệ, cùng với thử nghiệm mở rộng sau triển khai và thử nghiệm của bên thứ ba.
Tình trạng sẵn có và giá cả
Grok 4.6 hiện đã có sẵn trong Cursor và Grok Build. xAI sẽ cung cấp mức sử dụng tăng gấp đôi trên cả hai nền tảng trong tuần đầu tiên. Giá bắt đầu ở mức 2 đô la trên một triệu mã thông báo đầu vào và 6 đô la trên một triệu mã thông báo đầu ra, với một biến thể nhanh có sẵn với mức giá gấp đôi. Số lần truy cập bộ đệm được giảm giá xuống còn 0,50 USD trên một triệu mã thông báo.
Việc phát hành tiếp tục nhịp độ nhanh chóng cho xAI, với Grok 4.6 ra mắt chỉ hơn một tháng sau Grok 4.5. Mô hình này định vị xAI là một đối thủ nặng ký trong cuộc đua biên giới, đặc biệt đối với các nhà phát triển ưu tiên hiệu suất tác nhân và hiệu quả chi phí.
Đi trước AI
Để liên tục đưa tin về những bước phát triển quan trọng nhất của ngành AI, hãy đánh dấu AI Buzz Wire và không bao giờ bỏ lỡ tin tức nóng hổi nào.
Đọc thêm tin tức về AI