OpenAI đã phát hành GPT-6.1 Sol vào ngày 29 tháng 9, ngừng hoạt động GPT-6 Sol chỉ bảy ngày sau khi mẫu đó ra mắt, theo công ty đo điểm chuẩn độc lập Artificial Analysis. Việc hoán đổi diễn ra trùng với hội nghị nhà phát triển DevDay của công ty, nơi CNET đưa tin rằng những người tham dự có thể bắt đầu sử dụng GPT-6.1 Sol ngay lập tức cùng với các đại lý Dots mới ra mắt và một loạt các thay đổi về đăng ký.

Việc thay thế hàng đầu trong bảy ngày là điều bất thường ngay cả đối với các tiêu chuẩn được tăng tốc vào năm 2026 và các điểm chuẩn cho thấy lý do tại sao OpenAI lại phát triển nhanh chóng. Để liên tục đưa tin về các buổi ra mắt mẫu máy, các cuộc chiến về điểm chuẩn và cuộc chiến về giá cả, AI Buzz Wire theo dõi những diễn biến quan trọng khi chúng diễn ra.

Một bước nhảy vọt có thể đo lường được trong bảy ngày

Phân tích nhân tạo báo cáo rằng GPT-6.1 Sol tăng 4 điểm về Chỉ số thông minh của công ty so với GPT-6 Sol và 5 điểm so với GPT-5.6 Sol, chỉ kém GPT-6 Astra 1 điểm, mẫu có khả năng nhất của OpenAI. Đánh giá của công ty kết hợp các nhiệm vụ lý luận, công việc tri thức, toán học và tác nhân vào một điểm so sánh duy nhất.

Điểm phụ cho thấy lợi ích tập trung ở đâu. GPT-6.1 Sol đã cải thiện 4 điểm trong AA-Briefcase v1.1 và 5 điểm trong GDPval-AA v2.1, cả hai đều kiểm tra kiến ​​thức tác nhân hoạt động. Mức tăng 12 điểm trong Terminal-Bench 4.0 cho thấy hiệu suất tốt hơn về mặt vật chất trong môi trường thiết bị đầu cuối thực, trong khi Bài kiểm tra cuối cùng của Nhân loại tăng 5 điểm và GDP.pdf tăng 6 điểm.

Một con số nổi bật đối với những ai sử dụng mô hình để nghiên cứu: độ chính xác của AA-Omniscience tăng 8 điểm trong khi tỷ lệ ảo giác giảm từ 60% xuống 54%. Cả hai con số đều ở mức cao về mặt tuyệt đối, nhưng hướng di chuyển rất quan trọng đối với quy trình làm việc mà một câu trả lời sai chắc chắn còn tệ hơn là không có câu trả lời.

Giá dán giống nhau, thực tế rẻ hơn

Về giá cả, GPT-6.1 Sol giữ mức giá của GPT-6 Sol là 2 đô la trên một triệu mã thông báo đầu vào và 10 đô la trên một triệu mã thông báo đầu ra, nhưng chiết khấu đọc bộ đệm tăng từ 90% lên 95%. Phân tích nhân tạo lưu ý rằng giá hỗn hợp của GPT-6.1 Sol dành cho khối lượng công việc đại lý thấp hơn một chút so với GPT-6 Sol, kéo dài chuỗi giảm giá hiệu quả bắt đầu khi GPT-6 Sol ra mắt với mức chiết khấu 50% so với GPT-5.6 Sol.

Quỹ đạo định giá là câu chuyện có thật ở đây. Trong vòng hai lần phát hành, OpenAI đã hai lần giảm gần một nửa chi phí thực tế của tuyến biên giới hạng trung, đồng thời thúc đẩy chất lượng tăng lên mỗi lần.

Chi phí cho mỗi nhiệm vụ: 0,72 USD so với 3,26 USD

Chi phí cho mỗi nhiệm vụ là nơi mà khoảng cách với GPT-6 Astra trở nên rõ ràng. Với nỗ lực tối đa, Phân tích nhân tạo chốt GPT-6.1 Sol ở mức 0,72 USD cho mỗi nhiệm vụ Chỉ số thông minh, chưa bằng một phần tư so với 3,26 USD của GPT-6 Astra. So với người tiền nhiệm của nó, mức tiết kiệm là 31% ($1,05 cho GPT-6 Sol) và so với GPT-5.6 Sol, chúng đạt 64% ($1,99).

Theo công ty, mọi mức độ nỗ lực của GPT-6.1 Sol đều đẩy giới hạn Pareto về hiệu quả chi phí – có nghĩa là đối với một mức độ thông minh nhất định, không có lựa chọn nào rẻ hơn trong số các mẫu mà nó theo dõi. Bức tranh về hiệu quả của mã thông báo hỗn hợp hơn: GPT-6.1 Sol tiêu thụ mã thông báo đầu ra nhiều hơn khoảng 10 đến 30 phần trăm so với GPT-6 Sol ở các mức nỗ lực, mặc dù cài đặt nỗ lực thấp và trung bình của nó vẫn ở mức tối ưu Pareto cho hiệu quả của mã thông báo khi tính thông minh cao hơn được đưa vào. Trong mã hóa, mô hình đã đạt được 3 điểm so với GPT-6 Sol với nỗ lực tối đa trên Chỉ số tác nhân mã hóa của công ty.

Tại sao thời gian quay vòng bảy ngày lại quan trọng

Phương tiện chặn rộng hơn của DevDay củng cố bức tranh tương tự. Báo cáo của CNET đã trình bày hội nghị xoay quanh ba thứ mà các nhà phát triển có thể sử dụng ngay lập tức — GPT-6.1 Sol, các đại lý Dots và các gói đăng ký được làm lại — thay vì một bản xem trước nghiên cứu xa vời. Thông điệp gửi tới các nhà phát triển là khả dụng hôm nay chứ không phải ngày mai.

Nhịp điệu của các hãng hàng đầu đưa ra tín hiệu ngắn gọn này cho thấy hạn chế cạnh tranh đã chuyển từ hoạt động đào tạo sang sàng lọc sau đào tạo và cơ sở hạ tầng phục vụ. Một bản nâng cấp cấp điểm sẽ được triển khai trong một tuần trông giống như một điểm kiểm tra được tối ưu hóa và một bảng giá mới hơn là một mô hình nền tảng ngay từ đầu và các đối thủ cũng đang hoạt động theo cách tương tự: Google đã công bố Gemini 4 Argon vào ngày 30 tháng 9, một mô hình biên giới ban đầu tiếp cận những người bảo vệ mạng đáng tin cậy thông qua Chương trình Fairwind với cùng tỷ lệ 2/10 USD trên một triệu token.

Đối với các nhà phát triển, có ba bài học thực tế rút ra từ những con số đã được xác minh. Đầu tiên, khối lượng công việc tác nhân sử dụng lại bộ nhớ đệm nặng sẽ được hưởng lợi ngay lập tức từ việc giảm 95% bộ nhớ đệm. Thứ hai, ngân sách nên lập mô hình mức tiêu thụ mã thông báo đầu ra cao hơn trước khi di chuyển, vì giá mỗi mã thông báo không thay đổi ngay cả khi mô hình suy nghĩ lâu hơn. Thứ ba, Astra vẫn là mức trần cho các nhiệm vụ mà điểm thông minh cuối cùng có giá trị gấp 4 lần chi phí — trường hợp của GPT-6.1 Sol là đối với hầu hết các công việc thì không phải như vậy.

Cần nhắc lại: những số liệu này đến từ một cơ quan đánh giá độc lập duy nhất, cho dù phương pháp của họ có khắt khe đến đâu và điểm số chỉ số khen thưởng cho các hỗn hợp khối lượng công việc cụ thể. Các nhóm có khối lượng công việc đòi hỏi khắt khe nên chạy lại các đánh giá của riêng họ trước khi định tuyến lại lưu lượng sản xuất.

---

Đi trước AI

Nhận tin tức, phân tích và đột phá mới nhất về AI — tất cả ở cùng một nơi.

Đọc thêm tin tức về AI →