Một tiêu chuẩn mới có tên Real-SWE đang thách thức cách ngành công nghiệp AI đo lường khả năng mã hóa và những kết quả đầu tiên thật đáng xấu hổ đối với các phòng thí nghiệm ở tuyến đầu. Anthropic's Fable 5.1, chạy bên trong bộ khai thác Claude Code, dẫn đầu bảng với tỷ lệ phân giải 38,8% đối với các nhiệm vụ được rút ra từ cơ sở mã doanh nghiệp tư nhân trong thế giới thực. Không có mô hình nào được thử nghiệm đạt 40%.

Điểm chuẩn, được phát hành trong tháng này bởi Phòng thí nghiệm cụ thể, đánh giá các mô hình AI hàng đầu trên cơ sở mã sản xuất tư nhân mà nhóm đã cấp phép từ các công ty thực. Những người tạo ra nó lập luận rằng các nhiệm vụ do chuyên gia tạo ra hoặc tổng hợp, dù được thiết kế tốt đến đâu, không phải là công việc đúng nguyên văn mà các kỹ sư tại các công ty thực sự thực sự làm. For more context on this story, see our ongoing AI industry coverage.

Tại sao cơ sở mã riêng lại thay đổi hình ảnh

Theo các tác giả của nó, Real-SWE khác với các tiêu chuẩn đã được thiết lập như băng ghế dự bị SWE trên hai trục: tạo tác mã hóa cơ bản và tính đặc hiệu của hướng dẫn. Mỗi nhiệm vụ đều đến từ một hệ thống độc quyền có mã và giải pháp không có sẵn trên internet công cộng, điều đó có nghĩa là các nhân viên không thể dựa vào các câu trả lời đã ghi nhớ được lấy từ kho lưu trữ công cộng.

Các nhiệm vụ cũng mang lại hậu quả kinh doanh. Các nhiệm vụ mẫu của điểm chuẩn bao gồm nhận đúng quyền thanh toán, tính thuế và di chuyển khách hàng — những thay đổi ảnh hưởng đến cách hoạt động của doanh nghiệp, thường là trên nhiều dịch vụ. Mỗi công ty đều có những quy ước và cách viết mã riêng và các đại lý phải hiểu những quy tắc đó và thực hiện những thay đổi phù hợp với những gì đã có.

"Một tác nhân mã hóa có thể thực sự làm được công việc của một kỹ sư phần mềm trong thế giới thực không?" phần giới thiệu của điểm chuẩn yêu cầu. Hiện tại, bảng xếp hạng gợi ý câu trả lời là: tốt nhất chỉ khoảng một phần ba thời gian.

Bảng xếp hạng đầy đủ

Phòng thí nghiệm cụ thể đã đánh giá tám kết hợp mô hình và khai thác biên giới, đo lường tốc độ phân giải ở mức pass@1 tính trung bình trên tám lần chạy độc lập cho mỗi tác vụ, với khoảng tin cậy 95%:

1. Truyện ngụ ngôn 5.1 (Mã Claude) — 38,8%
2. GPT-6 Astra (Codex CLI) — 33,8%
3. Flash Song Tử 3.8 (Gemini CLI) — 31,2%
4. GLM 5.3 (Mã Claude) — 28,8%
5. (hòa) Grok 4.6 (Grok Build) — 23,8%
5. (hòa) Muse Spark 1.3 (Muse Code) — 23,8%
7. Kimi K3 (Mã Kimi) — 18,8%
8. GPT-5.6 Sol (Codex CLI) — 16,2%

Các kết quả đã được thảo luận rộng rãi trên Hacker News vào cuối tuần qua, nơi điểm chuẩn đã thu hút hàng trăm lượt tán thành và một cuộc tranh luận sôi nổi về việc liệu đánh giá cơ sở mã riêng có phải là thước đo phù hợp cho sự tiến bộ của đại lý hay không.

Một mức chênh lệch hẹp nhưng có ý nghĩa ở đầu

Khoảng cách giữa bốn hệ thống hàng đầu là đáng chú ý vì những gì nó nói lên về bối cảnh cạnh tranh hiện tại. Fable 5.1 dẫn trước 5 điểm so với GPT-6 Astra của OpenAI rất có ý nghĩa trên một điểm chuẩn trong đó mọi nhiệm vụ đều là một vấn đề sản xuất thực sự. Gemini 3.8 Flash chiếm vị trí thứ ba là điều đáng chú ý vì mô hình này được định vị là một cỗ máy nhanh, chi phí thấp chứ không phải là một hệ thống suy luận hàng đầu. GLM 5.3 của Z.ai, được đánh giá thông qua Claude Code, đạt mức kém 5 điểm so với người dẫn đầu, nhấn mạnh mức độ cạnh tranh của các mô hình trọng lượng mở trong công việc kỹ thuật thực tế.

Điều đáng nói không kém là mức chênh lệch ở phía dưới. GPT-5.6 Sol, bản phát hành OpenAI trước đó, giải quyết ít hơn một nửa số nhiệm vụ so với Fable 5.1 - một lời nhắc nhở về tốc độ di chuyển của biên giới và mức độ tụt dốc có thể chỉ cách một thế hệ mô hình trở lại.

Khai thác vấn đề nhiều như mô hình

Một trong những lựa chọn về phương pháp luận của điểm chuẩn đang thu hút sự chú ý: thay vì đánh giá các mô hình một cách riêng biệt, Real-SWE sử dụng các khai thác gốc — Claude Code, Codex CLI, Gemini CLI, Grok Build — để phản ánh cách các kỹ sư doanh nghiệp thực sự làm việc trong thực tế. Bảng xếp hạng xếp hạng rõ ràng các kết hợp mô hình và dây nịt, thừa nhận rằng giàn giáo, truy cập công cụ và các vòng lặp hiện không thể tách rời khỏi khả năng của mô hình trong triển khai thực tế.

Việc đóng khung đó rất quan trọng đối với việc doanh nghiệp lựa chọn hệ thống. Cùng một mô hình có thể hoạt động rất khác nhau tùy thuộc vào khai thác tác nhân bao quanh nó và người mua đánh giá trợ lý mã hóa dựa trên các số điểm chuẩn công khai có thể nhận được một bức tranh méo mó về cách các hệ thống đó sẽ hoạt động trên cơ sở mã của riêng họ.

Ý nghĩa của nó đối với ngành

Điểm chuẩn đã nhiều lần bị cáo buộc là bão hòa, với các mô hình tiên phong đăng điểm gần như hoàn hảo trong các bài kiểm tra công khai và rò rỉ vào dữ liệu đào tạo. Thiết kế của Real-SWE cố gắng giải quyết cả hai vấn đề cùng một lúc: mã là riêng tư và được cấp phép, các nhiệm vụ là sản phẩm công việc thực sự của các nhóm kỹ thuật đang làm việc và các hướng dẫn phản ánh tính đặc thù lộn xộn của các vé thực thay vì các báo cáo vấn đề bóng bẩy.

Takeaway tỉnh táo là mức độ tuyệt đối. Ngay cả hệ thống tốt nhất cũng giải quyết được ít hơn 4/10 nhiệm vụ thực tế của doanh nghiệp trong lần thử đầu tiên, tính trung bình trong 8 lần chạy. Đối với tất cả những tiến bộ trong mã hóa tác nhân, điểm chuẩn cho thấy rằng kỹ thuật phần mềm tự động trên các hệ thống sản xuất thực vẫn là một hoạt động được giám sát - một hoạt động mà các kỹ sư con người xem xét, chuyển hướng và sửa chữa thường xuyên hơn nhiều so với các bản demo của nhà cung cấp.

Đối với các doanh nghiệp lựa chọn trong số các trợ lý mã hóa, điểm chuẩn cung cấp một danh sách kiểm tra thực tế: ưu tiên các hệ thống được đánh giá dựa trên mã riêng, nhấn mạnh vào khoảng tin cậy thay vì các số tiêu đề chạy một lần và chất lượng khai thác trọng lượng cũng như khả năng của mô hình thô. Bảng xếp hạng đầu tiên của Real-SWE sẽ không phải là từ cuối cùng — nhưng nó là câu trả lời trực tiếp nhất cho câu hỏi mà mọi nhà lãnh đạo kỹ thuật đang đặt ra về mã hóa tác nhân.

Để biết thêm về các tác nhân mã hóa, các bản phát hành mô hình và nghiên cứu định hình chúng, hãy theo dõi tin tức AI mới nhất khi vòng kết quả điểm chuẩn tiếp theo xuất hiện.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →