OpenAI đã âm thầm giảm cửa sổ ngữ cảnh làm việc cho tác nhân mã hóa Codex và dòng mô hình GPT-5.6 cơ bản, cắt giảm giới hạn có thể sử dụng từ khoảng 372.000 mã thông báo xuống còn 272.000 mã thông báo. Thay đổi này xuất hiện thông qua yêu cầu kéo được hợp nhất trên kho lưu trữ Codex nguồn mở của công ty, đã thu hút phản ứng gay gắt từ các nhà phát triển dựa vào bối cảnh lớn để phân tích toàn bộ cơ sở mã trong một lần chuyển.

Sự điều chỉnh này phản ánh tình trạng căng thẳng quen thuộc trong ngành AI, nơi các công ty cân bằng chi phí suy luận theo ngữ cảnh dài với sự tiện lợi mà nó mang lại cho người dùng. Đối với thông tin mới nhất về ngành AI, động thái này nhấn mạnh rằng ngay cả những thay đổi nhỏ đối với siêu dữ liệu mô hình cũng có thể ảnh hưởng đến hàng triệu quy trình làm việc của nhà phát triển.

Điều gì đã thay đổi và nó được phát hiện ở đâu

Mức giảm được hiển thị trong tệp siêu dữ liệu mô hình đi kèm của kho lưu trữ Codex, `codex-rs/models-manager/models.json`. Một yêu cầu kéo có tiêu đề "Backport đã làm mới siêu dữ liệu của mô hình đi kèm thành 0.144", do kỹ sư Sayan-oai của OpenAI soạn thảo và được hợp nhất vào ngày 18 tháng 7 năm 2026, đã làm mới siêu dữ liệu mà các máy khách Codex ổn định sử dụng để hiểu khả năng của từng mô hình.

Tệp hiện tại hiển thị giá trị `context_window` là 272.000 mã thông báo trên dòng GPT-5.6, bao gồm các biến thể GPT-5.6-Sol, GPT-5.6-Terra và GPT-5.6-Luna, cũng như các mục nhập GPT-5.5 và GPT-5.2 cũ hơn. Theo cuộc thảo luận trên Hacker News, nơi thay đổi đã thu hút hơn 350 lượt tán thành, giới hạn hoạt động trước đó là khoảng 372.000 token. Một số mô hình giữ lại `max_context_window` cao hơn lên tới một triệu mã thông báo, nhưng thời lượng mặc định mà khách hàng thực sự yêu cầu hiện giới hạn ở mức 272.000.

Sự khác biệt đó rất quan trọng. Cửa sổ ngữ cảnh tối đa thể hiện những gì mô hình có thể chấp nhận về mặt lý thuyết, trong khi `context_window` đang hoạt động là những gì máy khách Codex được định cấu hình để gửi theo mặc định. Trên thực tế, điều đó có nghĩa là các nhà phát triển trước đây đã cung cấp cho đại lý hàng trăm nghìn mã thông báo mã nguồn giờ đây sẽ đạt mức trần sớm hơn.

Tại sao độ dài ngữ cảnh lại quan trọng đối với tác nhân mã hóa

Đối với một tác nhân mã hóa như Codex, cửa sổ ngữ cảnh không phải là một thước đo phù phiếm. Nó xác định lượng kho lưu trữ mà mô hình có thể "nhìn thấy" cùng một lúc khi suy luận về một lỗi, tạo ra một tính năng hoặc tái cấu trúc một mô-đun. Việc giảm 100.000 mã thông báo có nghĩa là sẽ có ít hơn khoảng 75.000 từ mã, nhận xét và tài liệu được tải vào một lời nhắc.

Theo thuật ngữ trong thế giới thực, đó có thể là sự khác biệt giữa một tác nhân hiểu toàn bộ dịch vụ vi mô từ đầu đến cuối và cần vận hành với một chế độ xem một phần, bị cắt ngắn. Các nhà phát triển làm việc trên các kho lưu trữ đơn lớn hoặc thực hiện di chuyển nhiều tệp bị ảnh hưởng nhiều nhất vì nhiệm vụ của họ phụ thuộc vào việc giữ nhiều tệp trong ngữ cảnh cùng một lúc.

Sự thay đổi diễn ra khi các công cụ mã hóa tác nhân cạnh tranh gay gắt về mức độ chúng có thể xử lý được. Các đối thủ đã tiếp thị các cửa sổ ngữ cảnh khổng lồ như một điểm bán hàng quan trọng, định hình khả năng sử dụng toàn bộ cơ sở mã như con đường hướng tới công nghệ phần mềm tự động thực sự. Pullback của OpenAI thu hẹp khoảng cách đó ở mức mặc định.

Chi phí, chất lượng và tính kinh tế của bối cảnh lâu dài

Động lực có thể là chi phí. Các bối cảnh dài hơn sẽ tốn kém hơn đáng kể khi xử lý, cả về tính toán và độ trễ, vì mô hình phải tham dự mọi mã thông báo trong đầu vào. Tỷ lệ thất bại "mò kim đáy bể" cao cũng có xu hướng tăng lên khi bối cảnh kéo dài, có nghĩa là các mô hình đôi khi bỏ lỡ thông tin được chôn sâu trong một dấu nhắc dài. Việc giới hạn khoảng thời gian mặc định có thể giảm các vấn đề về độ chính xác này trong khi cắt giảm chi tiêu suy luận.

OpenAI đã không công bố một thông báo riêng giải thích về việc cắt giảm. Thay đổi chỉ được thực hiện thông qua quá trình làm mới siêu dữ liệu và cổng ngược sang dòng phát hành 0.144, đây là nhánh được chuyển đến hầu hết người dùng Codex không phải alpha. Bản thân việc triển khai cấu hình thấp đó đã rất đáng chú ý: một quyết định ảnh hưởng trực tiếp đến năng suất của nhà phát triển đã được truyền đạt thông qua sự khác biệt về mã thay vì một bài đăng trên blog hoặc nhật ký thay đổi.

Đối với các đội, ý nghĩa thực tế rất đơn giản. Các tác vụ trước đây phù hợp với một lần chuyển ngữ cảnh giờ đây có thể yêu cầu chia công việc thành các phần nhỏ hơn, truy xuất các tệp có liên quan một cách chọn lọc hơn hoặc chấp nhận rằng tác nhân có trường xem hẹp hơn. Một số nhà phát triển có thể định tuyến xung quanh giới hạn bằng cách dựa vào `max_context_window` cao hơn nếu có, mặc dù việc làm như vậy thường yêu cầu cấu hình rõ ràng.

Một mô hình điều chỉnh yên tĩnh rộng hơn

Việc cắt ngữ cảnh Codex phù hợp với mô hình ngành rộng hơn, trong đó các phòng thí nghiệm AI điều chỉnh các tham số của mô hình của họ giữa các lần ra mắt tiêu đề. Kích thước cửa sổ, giới hạn tỷ lệ và hành vi mặc định thường xuyên được điều chỉnh thông qua các bản cập nhật cơ sở hạ tầng mà không bao giờ được đưa ra thông cáo báo chí. Các nhà phát triển phụ thuộc vào các hệ thống này ngày càng theo dõi các kho lưu trữ cơ bản và phản hồi API để tìm các tín hiệu sớm.

Động thái của OpenAI cũng làm nổi bật khoảng cách giữa tiếp thị và thực tế. Một mô hình có thể hỗ trợ độ dài ngữ cảnh của tiêu đề, nhưng khoảng thời gian hiệu quả mà sản phẩm thực sự bộc lộ có thể nhỏ hơn đáng kể, được định hình bởi các quyết định về chi phí mà nhà cung cấp thay mặt cho người dùng đưa ra.

Đi trước AI

Các tham số mô hình thay đổi liên tục và các công cụ mà nhà phát triển phụ thuộc vào có thể thay đổi chỉ sau một đêm. Để biết báo cáo kịp thời về các bản phát hành, những thay đổi về khả năng và tính kinh tế của AI tiên phong, hãy theo dõi tin nóng về AI tại AI Buzz Wire.

Đọc thêm tin tức về AI →