Anthropic đã tiết lộ Claude Opus 5, một mô hình AI mới mà công ty cho biết mang lại trí thông minh gần biên giới với mức giá chỉ bằng một nửa so với mẫu Fable 5 hàng đầu của họ. Được phát hành vào ngày 24 tháng 7 năm 2026, Opus 5 hiện là mô hình mặc định trên Claude Max và là mô hình mạnh nhất hiện có trên Claude Pro, định vị nó là công cụ hỗ trợ hàng ngày của Anthropic cho mã hóa, tác nhân tự trị và công việc kiến ​​thức chuyên môn.

Sự ra mắt diễn ra vào thời điểm các doanh nghiệp đang xem xét kỹ lưỡng chi tiêu cho AI. Theo CNBC, mô hình mới "đối đầu với Fable 5 và rẻ hơn khi các doanh nghiệp lo lắng về chi phí", trong khi Bloomberg mô tả nó là "mô hình tiết kiệm chi phí hơn cho các công việc hàng ngày". Đối với các nhóm theo dõi sự phát triển AI mới nhất, Opus 5 đại diện cho sự đặt cược có chủ ý rằng chiến trường cạnh tranh tiếp theo là giá trị chứ không phải ưu thế chuẩn mực thô.

Hiệu suất điểm chuẩn: Công nghệ tiên tiến mới về mã hóa và công việc tri thức

Anthropic báo cáo rằng Opus 5 đăng các kết quả tiên tiến về mã hóa và đánh giá công việc tri thức bao gồm Frontier-Bench và GDPval-AA. Trên Frontier-Bench v0.1, công ty cho biết Opus 5 vượt qua tất cả các mẫu khác và tăng hơn gấp đôi hiệu suất của phiên bản tiền nhiệm, Opus 4.8, với chi phí cho mỗi tác vụ thấp hơn.

Trên CursorBench 3.2, Opus 5 chỉ đạt 0,5% điểm cao nhất của Fable 5 trong khi chi phí cho mỗi nhiệm vụ chỉ bằng một nửa, theo điểm chuẩn riêng của Anthropic. Decrypt lưu ý rằng mô hình này "vượt qua Fable 5 trên hầu hết các điểm chuẩn - với mức giá chỉ bằng một nửa."

Lợi ích mở rộng đến các đánh giá tác nhân và giải quyết vấn đề:

  • ARC-AGI 3: Opus 5 đạt điểm cao hơn khoảng ba lần so với mẫu tốt nhất tiếp theo trong bài kiểm tra giải quyết vấn đề mới lạ này.
  • Zapier AutomationBench: Tỷ lệ đạt khoảng 1,5 lần mô hình tốt nhất tiếp theo với cùng mức chi phí, đo lường mức độ hoàn thành nhiệm vụ kinh doanh từ đầu đến cuối.
  • OSWorld 2.0 (sử dụng máy tính): Opus 5 vượt qua kết quả tốt nhất của Fable 5 với chi phí chỉ hơn một phần ba.

Đáng chú ý, Anthropic thừa nhận rằng Opus 5 “vẫn đi sau Mythos 5 về các nhiệm vụ an ninh mạng”, một lĩnh vực mà mô hình biên giới đối thủ vẫn dẫn đầu.

Cơ quan mạnh mẽ hơn và tự xác minh

Chủ đề định kỳ trong thông báo là khả năng cải tiến của Opus 5 trong việc xác minh công việc của chính nó và lặp lại cho đến khi thành công. Anthropic đã mô tả một số ví dụ từ thử nghiệm truy cập sớm làm nổi bật tính tự chủ này.

Trong một nhiệm vụ của Frontier-Bench, mô hình được cung cấp bản vẽ của một bộ phận máy và được yêu cầu viết mã để tái tạo nó thành mô hình FreeCAD 3D - nhưng họ cố tình không cho phép xem bản vẽ trực tiếp. Opus 5 được cho là đã viết đường dẫn thị giác máy tính của riêng mình để trích xuất hình học từ các pixel thô, sau đó xây dựng lại toàn bộ phần, liên tục thành công khi không có mô hình cạnh tranh nào có thể giải quyết được nhiệm vụ sau năm lần thử.

Do một lỗi thực sự trong trình quản lý gói nguồn mở phổ biến, Opus 5 đã tìm ra nguyên nhân cốt lõi và khắc phục một trường hợp nghiêm trọng mà bản vá của chính cộng đồng đã bỏ sót, trong khi một mô hình cạnh tranh chỉ sửa lỗi triệu chứng bề mặt và tuyên bố lỗi đã được giải quyết. Một kỹ sư tại một công ty thương mại được cho là đã sử dụng Opus 5 để xây dựng nguồn cấp dữ liệu thị trường cho một sàn giao dịch mới trong một phiên duy nhất — một nhiệm vụ mà các mô hình trước đó không thể hoàn thành — và do không tìm thấy nguồn cấp dữ liệu trực tiếp nào để xác thực, mô hình đã xây dựng khai thác thử nghiệm của riêng mình.

Lễ tân đón tiếp khách hàng

Các đối tác tiếp cận sớm đưa ra những đánh giá phần lớn là tích cực. Scott Wu, Giám đốc điều hành của Cognition (nhà sản xuất tác nhân mã hóa Devin), cho biết Opus 5 "gần đạt hiệu suất ở cấp độ Fable với chi phí chỉ bằng một nửa" và cho thấy "sức mạnh đặc biệt trong các nhiệm vụ gỡ lỗi khó và phân tích nguyên nhân gốc rễ." Sualeh Asif, người đồng sáng lập Cursor, cho biết mô hình này mang lại "trí thông minh gần như Fable 5 với tốc độ và chi phí của Opus."

Wade Foster, Giám đốc điều hành của Zapier, đã báo cáo rằng Opus 5 "đứng đầu bảng xếp hạng AutomationBench của Zapier mà không tiêu nhiều mã thông báo hơn các mô hình Claude trước đó", hoàn thành toàn bộ quy trình làm việc ngăn chặn sự gián đoạn từ đầu đến cuối — gắn cờ các tài khoản có nguy cơ, cảnh báo cho đúng chủ sở hữu và tóm tắt cho các nhóm lưu giữ. Các mô hình trước đó không vượt qua được; Opus 5 đạt 100%.

Thành tựu trong nghiên cứu khoa học

Anthropic cũng nhấn mạnh những cải tiến của Opus 5 đối với công việc khoa học. Mô hình này vượt trội hơn Opus 4.8 trên mọi đánh giá về khoa học đời sống của Anthropic, bao gồm sinh học cấu trúc, hóa học hữu cơ và tin sinh học. Công ty đã chỉ ra mức cải thiện 10,2 điểm phần trăm trên điểm chuẩn hóa học hữu cơ nội bộ (suy ra cấu trúc phân tử từ dữ liệu quang phổ) và mức tăng 7,7 điểm trong các nhiệm vụ dự đoán chức năng protein. Một khách hàng về gen mô tả mô hình này hoạt động "giống như một nhà khoa học cẩn thận hơn", đạt được các thử nghiệm thống kê phù hợp và kiểm tra chéo kết quả của chính nó.

Chiến lược định giá

Bằng cách định giá Opus 5 ngang bằng với Opus 4.8 trong khi tiếp cận trí thông minh của Fable 5, Anthropic đang thu hẹp khoảng cách giữa các sản phẩm tầm trung và hàng đầu của mình một cách hiệu quả. VentureBeat mô tả việc phát hành là "một mô hình AI rẻ hơn cho mã hóa, đại lý và quy trình làm việc của doanh nghiệp" và Seeking Alpha nhận thấy rằng Opus 5 "gần hơn và rẻ hơn so với mô hình tiên phong Fable 5." Công ty cung cấp cài đặt "nỗ lực" có thể điều chỉnh cho phép khách hàng đánh đổi thông tin để lấy tốc độ và giảm chi phí mã thông báo, tinh chỉnh tỷ lệ chi phí trên hiệu suất cho mỗi nhiệm vụ.

Ý nghĩa của cuộc đua AI

Opus 5 nhấn mạnh chi phí của AI cận biên đang giảm nhanh như thế nào. Một mô hình có khả năng vượt trội so với các hệ thống có khả năng cao nhất hiện có — với giá chỉ bằng một nửa — gây áp lực cho các đối thủ cạnh tranh phải biện minh cho việc định giá cao hơn để đạt được lợi nhuận cận biên. Với việc Anthropic, OpenAI, Google và các công ty khác đang chạy đua để tạo ra các mô hình có khả năng đủ giá cả phải chăng để triển khai hàng ngày trên quy mô lớn, câu hỏi dành cho các doanh nghiệp đang chuyển từ "mô hình nào thông minh nhất?" đến "mô hình nào mang lại nhiều thông tin nhất trên mỗi đô la?"

Đối với Anthropic, thông điệp rất rõ ràng: lý luận cao cấp không còn là sản phẩm xa xỉ nữa. Opus 5 mang đến khả năng liền kề với mức giá giúp cho việc triển khai hàng ngày, bền vững trở nên thực tế — và đó có thể là chi tiết mang tính hệ quả nhất trong tất cả.

Đi trước AI

Claude Opus 5 có sẵn bắt đầu từ hôm nay trên Claude Pro, Claude Max và thông qua API của Anthropic. Để biết thêm về câu chuyện này và bối cảnh trí tuệ nhân tạo rộng hơn, hãy theo dõi tin tức nóng hổi về AI khi sự việc diễn ra.

Đọc thêm tin tức về AI →