OpenAI đã giảm giá API trên hai trong số ba mẫu GPT-5.6 vào ngày 30 tháng 7 năm 2026, cắt giảm 80% mức rẻ nhất chỉ ba tuần sau khi dòng này được tung ra thị trường. Động thái này báo hiệu mức độ cạnh tranh mạnh mẽ của nhà sản xuất mô hình hàng đầu để có được khối lượng công việc lớn, nhạy cảm với chi phí — và khách hàng của họ hiện đang đếm từng mã thông báo chặt chẽ như thế nào. Để biết thêm về sự thay đổi rộng lớn hơn trong kinh tế AI, hãy theo dõi những phát triển AI mới nhất của chúng tôi.

Điều gì đã thay đổi

Theo thẻ giá và nhật ký thay đổi API được công bố của OpenAI, giá tiêu chuẩn trên mỗi triệu mã thông báo hiện có nội dung:

  • GPT-5.6 Luna: 20 cent đầu vào và 1,20 USD đầu ra, giảm từ 1 USD và 6 USD — giảm 80%
  • GPT-5.6 Terra: $2 và $12, giảm từ $2,50 và $15 — giảm 20%
  • GPT-5.6 Sol (hàng đầu): $5 và $30, không thay đổi

Tất cả ba bậc đều được tung ra thị trường vào ngày 9 tháng 7 năm 2026 với mức giá cao hơn, khiến việc định giá lại chỉ còn 21 ngày đối với hoạt động thương mại của dòng sản phẩm này. Reuters và CNBC đều xác nhận việc cắt giảm và Axios báo cáo rằng mức giảm mạnh nhất rơi vào mẫu Luna.

Cắt giảm luồng qua mọi tầng dịch vụ

Việc giảm giá không chỉ giới hạn ở mức giá tiêu đề. Chúng chảy qua mọi tùy chọn trên bảng giá:

  • Xử lý hàng loạt và linh hoạt, cả hai đều có giá bằng một nửa tiêu chuẩn, đặt Luna ở mức 10 xu đầu vào và 60 xu đầu ra trên một triệu mã thông báo.
  • Số lượt đọc dữ liệu đầu vào được lưu trong bộ nhớ đệm, giảm giá 90%, giảm xuống còn 2 xu trên một triệu mã thông báo trên Luna và 20 xu trên Terra.
  • Các yêu cầu có ngữ cảnh dài, được tính phí gấp đôi tốc độ đầu vào và 1,5 lần đầu ra, đạt mức 40 xu và 1,80 USD cho Luna.

Đối với các nhóm đã định tuyến phân loại hàng loạt, trích xuất hoặc vòng lặp tổng đài viên dài thông qua các cấp rẻ hơn, các lệnh gọi tương tự hiện có mức phí chỉ bằng một phần nhỏ so với những gì họ đã thực hiện một ngày trước đó.

Các vết cắt so với Anthropic như thế nào

Với giá đầu vào là 20 xu và đầu ra là 1,20 đô la, Luna hiện đã bán rẻ hơn mô hình được xuất bản rẻ nhất của Anthropic, Haiku 4,5, khoảng năm lần về đầu vào và bốn lần về đầu ra, theo trang định giá của Anthropic. Mức giá mới của Terra nằm dưới mức 3 USD và 15 USD mà Claude Sonnet 5 dự kiến sẽ tính sau khi giá giới thiệu của nó hết hiệu lực vào ngày 31 tháng 8 năm 2026.

Đứng đầu cả hai dòng sản phẩm, Sol vẫn có chi phí sản xuất cao hơn Opus 5 của Anthropic, có giá 5 USD và 25 USD.

Xử lý ưu tiên chuyển sang chế độ Nhanh

Mục nhật ký thay đổi tương tự đã loại bỏ "Xử lý ưu tiên" và thay thế bằng "Chế độ nhanh". Đối với mẫu Sol hàng đầu, OpenAI cho biết Chế độ nhanh chạy nhanh gấp 2,5 lần tốc độ tiêu chuẩn với mức giá gấp đôi và công tắc tương thích ngược - các yêu cầu đã được gắn thẻ cho lộ trình ưu tiên sang chế độ Nhanh mà không cần thay đổi mã.

Giá ở chế độ nhanh là 10 USD và 60 USD cho Sol, 4 USD và 24 USD cho Terra, 40 xu và 2,40 USD cho Luna. Đáng chú ý, Anthropic bán cùng một sản phẩm có cùng tên và cùng điều khoản, đồng thời hai thẻ giá hiện cũng hội tụ về suy luận được xác định theo khu vực: OpenAI tính phí tăng 10% đối với các mô hình được phát hành vào hoặc sau ngày 5 tháng 3 năm 2026 khi khách hàng yêu cầu nơi lưu trữ dữ liệu, trong khi Anthropic tính phí suy luận chỉ ở Hoa Kỳ ở mức 1,1 lần mức tiêu chuẩn của nó.

Tại sao tầng rẻ hơn lại rẻ hơn

Một ngày trước khi cắt giảm, OpenAI đã xuất bản một bài đăng kỹ thuật mô tả các cách tối ưu hóa trên ngăn xếp suy luận của nó. Năm thành viên đội ngũ kỹ thuật của công ty đã viết rằng Sol, chạy bên trong công cụ mã hóa Codex, đã viết lại các nhân GPU sản xuất - công việc mà OpenAI cho biết đã cắt giảm 20% chi phí cung cấp dịch vụ từ đầu đến cuối. Mô hình này cũng đã thiết kế lại mô hình dự thảo giải mã suy đoán của riêng mình qua hàng trăm thử nghiệm, một thay đổi được cho là đã nâng cao hiệu quả tạo mã thông báo lên hơn 15%.

Đó là những số liệu riêng của OpenAI cho ngăn xếp của riêng nó, nhưng chúng chỉ ra cùng một trung tâm chi phí các địa chỉ giảm giá: khai thác đại lý đằng sau Codex và ChatGPT. Theo mặc định, công cụ OpenAI giới hạn đầu ra ở mức 10.000 mã thông báo và chỉ giữ lịch sử hiển thị cho mô hình ở phần bổ sung, do đó, một vòng lặp tác nhân gửi lại hướng dẫn của nó ở mỗi bước sẽ chạm vào bộ đệm nhắc thay vì phải trả toàn bộ tốc độ đầu vào. Công ty đã kết thúc bài đăng với cam kết cung cấp "những cải tiến cơ bản cho người dùng của chúng tôi dưới dạng thông tin thông minh có sẵn rộng rãi hơn, tiết kiệm chi phí hơn". Thẻ giá theo sau một ngày sau đó.

Đối tác đám mây và thanh toán

OpenAI lưu ý rằng người mua định tuyến lưu lượng truy cập qua Amazon Bedrock sẽ được AWS tính phí và những mức giá đó có thể khác với thẻ được xuất bản của chính nó. Khi ngày càng nhiều doanh nghiệp tập trung quyền truy cập mô hình thông qua một nhà cung cấp đám mây duy nhất, khoảng cách giữa giá trực tiếp của OpenAI và số tiền khách hàng thực sự thanh toán qua trung gian sẽ quan trọng như chính các con số tiêu đề.

Một thị trường đếm từng token

Việc cắt giảm đất đai khi doanh nghiệp mua hàng kiểm toán suy luận chi tiêu chặt chẽ hơn bao giờ hết. Đầu tuần, báo cáo đã ghi lại kỷ nguyên của “tokenmaxxing” không hạn chế — đẩy khối lượng mà không cần xem chi phí — đang mờ dần khi hóa đơn AI của công ty tăng đột biến trên các nền tảng chính. Quyết định của OpenAI chuyển khoản tiết kiệm chi phí nội bộ của mình cho khách hàng, thay vì ký quỹ, là một tín hiệu rõ ràng về nơi mà họ tin rằng cuộc chiến cạnh tranh hiện đang diễn ra: không phải ở tuyến đầu, nơi Sol vẫn đưa ra mức giá cao, mà ở mức giá rẻ, khối lượng lớn, nơi hầu hết lưu lượng sản xuất thực sự tồn tại.

Với giá của Sol không thay đổi, quyết định trực tiếp dành cho các nhà phát triển vẫn giữ nguyên chính xác vị trí mà OpenAI đã đặt ra kể từ khi dòng sản phẩm này được chuyển đi: mỗi yêu cầu yêu cầu cấp nào. Sự khác biệt là cái giá phải trả cho việc đưa ra quyết định sai lầm vừa giảm đáng kể.

---

Đi trước AI

Nhận tin tức, phân tích và đột phá mới nhất về AI — tất cả ở cùng một nơi.

Đọc thêm tin tức về AI →