Theo thông báo chính thức của công ty, Anthropic đã thông báo vào thứ Năm, ngày 4 tháng 9 năm 2026 rằng Claude đã tạo ra bằng chứng hoàn chỉnh đầu tiên được kiểm tra bằng máy tính về Định lý cuối cùng của Fermat, một trong những kết quả nổi tiếng nhất trong toán học, hoạt động chủ yếu một cách tự động trong 11 ngày và viết 13 triệu dòng mã bằng ngôn ngữ lập trình Lean.
Cột mốc quan trọng này đã thu hút sự chú ý ngay lập tức trong cộng đồng nghiên cứu, đứng đầu Tin tức Hacker trong vòng vài giờ sau khi xuất bản. Việc chứng minh chính thức định lý này dự kiến sẽ phải mất nhiều năm nỗ lực của cộng đồng; thay vào đó, một nhóm gồm hàng chục đặc vụ Claude cộng tác đã hoàn thành công việc trong vòng chưa đầy hai tuần. Để biết thêm bối cảnh về vị thế của khả năng AI ngày nay, hãy xem những phát triển AI mới nhất của chúng tôi.
Định lý cuối cùng của Fermat là gì - và tại sao nó chống lại việc chứng minh trong suốt 350 năm
Định lý cuối cùng của Fermat phát biểu rằng không có số nguyên dương a, b và c nào có thể thỏa mãn phương trình aⁿ + bⁿ = cⁿ với bất kỳ giá trị nào của n lớn hơn 2. Pierre de Fermat đã ghi lại tuyên bố này vào khoảng năm 1637 bên lề cuốn Số học của Diophantus, đồng thời thêm vào ghi chú huyền thoại của ông rằng ông đã phát hiện ra một bằng chứng thực sự kỳ diệu mà lề quá hẹp để chứa đựng.
Trong hơn ba thế kỷ, giả thuyết này đã tồn tại lâu hơn mọi nỗ lực chứng minh nó. Theo lời kể của Anthropic, giải thưởng trị giá 100.000 mác vàng Đức được công bố vào năm 1908 đã thu hút 621 lần thử sai chỉ trong năm đầu tiên. Ngài Andrew Wiles cuối cùng đã đưa ra được bằng chứng chính xác vào năm 1993 - chỉ để những người đánh giá phát hiện ra một lỗ hổng nghiêm trọng sau hai tháng xác minh. Wiles đã dành một năm để sửa chữa chứng minh với học trò cũ của ông là Richard Taylor trước khi xuất bản phiên bản dài 129 trang vào tháng 5 năm 1995, mất nhiều tháng làm việc cật lực để xác minh.
Cách Claude xây dựng bằng chứng 13 triệu dòng
Dự án được khởi xướng bởi Tianyi Peng, một nhà nghiên cứu Nhân chủng học thuộc nhóm tại Đại học Columbia xây dựng các công cụ để chính thức hóa AI. Ông bắt đầu kiểm tra xem liệu Claude có thể đạt được tiến bộ trong việc chuyển đổi bằng chứng của Wiles sang dạng có thể kiểm tra bằng máy hay không.
Nỗ lực này chỉ thành công sau khi thay đổi cách tiếp cận. Anthropic báo cáo rằng những nỗ lực ban đầu của các đặc vụ đã thất bại vì họ mất dấu trạng thái của dự án và ngừng cộng tác hiệu quả. Bước đột phá đến với Prove2Me, một nền tảng hợp tác mở để chính thức hóa toán học do Peng và các cộng tác viên tại Columbia thiết kế. Nền tảng này duy trì một biểu đồ tuần hoàn có hướng của các phát biểu định lý mà các tác nhân sử dụng để quyết định điều gì cần chứng minh tiếp theo, tăng tốc quá trình biên dịch Lean bằng cách tách các phát biểu khỏi chứng minh và cho phép các tác nhân tìm kiếm và sử dụng lại kết quả thông qua các mô tả ngôn ngữ tự nhiên của từng định lý.
Chạy trên hệ thống khai thác đa tác nhân dựa trên Mã Claude, nhóm đặc vụ đã tiêu thụ khoảng sáu tỷ mã thông báo đầu ra từ mô hình nghiên cứu nội bộ mà Anthropic mô tả gần như có thể so sánh với Claude Fable 5.1. Đầu vào của con người bị giới hạn ở các hướng dẫn cấp cao không thường xuyên - Anthropic trích dẫn các thông báo như "Jacobian như một sơ đồ có vẻ có mức độ ưu tiên cao" và yêu cầu thúc đẩy định lý Mazur sớm được thực hiện. Bằng chứng hoàn thành lúc 02:00 UTC ngày 18 tháng 8, khi định lý gốc của nền tảng chuyển sang Đã được chứng minh.
Trong quá trình đó, Claude đã chứng minh được 30.300 định lý, sử dụng 29.500 định lý trong số đó trong chứng minh cuối cùng. Với 13 triệu dòng Lean, kết quả lớn hơn gấp năm lần so với Mathlib, thư viện cộng đồng chính về toán học chính thức. Chứng minh tuân theo sự trình bày đơn giản hóa lập luận của Wiles của Henri Darmon, Fred Diamond và Richard Taylor, và điều chỉnh các phần của dự án chính thức hóa Đại học Hoàng gia Luân Đôn do Kevin Buzzard lãnh đạo.
Tại sao Bằng chứng tinh gọn lại giải quyết được câu hỏi
Người quyết định kết quả là trọng tài. Các trợ lý chứng minh như Lean xác minh logic của một bằng chứng bằng thuật toán và Anthropic nói rằng bằng chứng của Claude chỉ sử dụng ba tiên đề tiêu chuẩn của Lean, với một bộ so sánh xác nhận rằng phát biểu của định lý phù hợp với công thức định lý của Mathlib. Công ty cũng đã công bố bằng chứng trong kho lưu trữ công khai trên GitHub.
Buzzard, người xem xét kết quả, đã khẳng định rõ ràng: "Thành tựu tự động hóa hình thức phi thường này, mà các nhà nghiên cứu Nhân chủng học cho biết chỉ mất 11 ngày, đã chứng minh Định lý cuối cùng của Fermat mà không có giả định nào khác ngoài các tiên đề toán học."
Anthropic cẩn thận định vị tính mới một cách chính xác. Không giống như nghiên cứu gần đây dựa trên AI về giả thuyết Riemann, vốn tạo ra toán học mới, không có gì ở đây là toán học mới - thành tựu là xác minh, kiểm tra bằng chứng hiện có theo cách máy tính kiểm tra số học. Cho rằng Lean - không phải Anthropic - là cơ quan có thẩm quyền cuối cùng về tính đúng đắn, tuyên bố này không dựa trên đánh giá của chính công ty về mô hình của mình.
Ý nghĩa của Toán học và Nghiên cứu AI
Những hàm ý cắt giảm cả hai cách. Đối với các nhà toán học, quá trình tự động hóa có thể phát hiện các lỗi trong kho kiến thức hiện có và giảm bớt đáng kể gánh nặng đánh giá các kết quả mới, một quá trình có thể mất nhiều năm. Buzzard viết trong một bài đăng blog tiếp theo có tiêu đề “Anthropic đã đánh bại tôi”, thừa nhận rằng nỗ lực do cộng đồng lãnh đạo của chính ông, bắt đầu vào năm 2024, đã bị vượt qua.
Đối với các phòng thí nghiệm AI, kết quả cho thấy các công cụ chính thức có thể khắc phục một trong những điểm yếu khét tiếng nhất của công nghệ. Anthropic lưu ý rằng việc viết Lean dường như giúp Claude chứng minh những kết quả mới, với việc các tác nhân sử dụng các bằng chứng hình thức từng phần để kiểm tra độc lập các giả thuyết giống như cách họ viết các mô phỏng số. Công ty cũng lập luận rằng rào cản gia nhập đang sụp đổ: trong một thử nghiệm nhỏ, ba kế hoạch Claude Max cá nhân là đủ để các đại lý cộng tác chính thức hóa Định lý ba số nguyên tố của Vinogradov trong ba ngày.
Những lời cảnh báo vẫn có thật. Bằng chứng yêu cầu một nền tảng được xây dựng có mục đích, hàng tỷ mã thông báo và tiêu chí thành công rõ ràng khác thường - việc kiểm tra khóa trả lời đã tồn tại dễ dàng hơn việc khám phá các định lý mới. Nhưng như một minh chứng cho thấy các hệ thống AI hiện có thể chính thức hóa toán học ở mức cao nhất, 11 ngày chống lại bài toán kéo dài 358 năm khiến quan điểm này trở nên sống động nhất có thể.
---
Đi trước AINhận tin tức, phân tích và đột phá mới nhất về AI — tất cả ở cùng một nơi.
Đọc thêm tin tức về AI →