Phòng thí nghiệm AI phi tập trung Prime Intellect đã công bố kết quả của một thử nghiệm quy mô lớn kiểm tra xem các mô hình AI tiên tiến ngày nay có thể thực hiện nghiên cứu máy học tự động tốt đến mức nào — và những mô hình tốt nhất trong số đó đã gần đạt được kỷ lục thế giới của con người theo tiêu chuẩn cộng đồng nổi tiếng.
Dự án có tên NanoGPT Speedrun Frontier và được xuất bản vào ngày 22 tháng 8, bao gồm 153 lần chạy tự động trên 18 mô hình biên giới thử chạy tốc độ tối ưu hóa nanoGPT - một cuộc thi trong đó các nhà nghiên cứu tìm kiếm cách hiệu quả nhất để huấn luyện một mô hình ngôn ngữ nhỏ cho mục tiêu chất lượng cố định. Câu chuyện nhanh chóng leo lên trang nhất của Hacker News, nơi nó thu hút hàng chục bình luận tranh luận về kết quả nói lên điều gì về khả năng khám phá khoa học thực sự của AI. For more context on this story, see our ongoing artificial intelligence updates.
Speedrun NanoGPT thực sự là gì
Điểm chuẩn đến từ kho lưu trữ nanogpt đã được sửa đổi do Keller Jordan duy trì và một danh sách dài những người đóng góp cho cộng đồng. Thử thách được nêu ra có vẻ đơn giản: sử dụng 8 GPU NVIDIA H100, huấn luyện mô hình ngôn ngữ đạt mức mất entropy chéo 3,28 trên bộ xác thực FineWeb — mức hiệu suất mà bản sao GPT-2 ban đầu của Andrej Karpathy đạt được sau 45 phút — nhanh nhất có thể.
Thông qua hàng trăm đóng góp của cộng đồng trong hai năm qua, kỷ lục con người đã giảm xuống dưới 75 giây và dưới 400 triệu mã thông báo đào tạo, cải tiến hơn 30 lần so với công thức ban đầu. Các giải pháp chiến thắng trông giống như một danh mục công nghệ ML hiện đại: trình tối ưu hóa Muon, nhúng quay với QK-Norm, kích hoạt bình phương ReLU, lượng tử hóa FP8 trên sự chú ý và chuyển MLP, Flash Chú ý 3 với các mẫu cửa sổ trượt và hàng chục kỹ thuật khác xếp chồng lên nhau.
Thử nghiệm của Prime Intellect đã sử dụng trình tối ưu hóa của điểm chuẩn, theo tài liệu của kho lưu trữ, giảm thiểu số bước đào tạo cần thiết để đạt được mục tiêu bị mất, tuân theo kiến trúc, tập dữ liệu và kích thước lô cố định, với ngân sách đồng hồ treo tường không giới hạn một cách hiệu quả. Điều đó khiến nó trở thành một thử nghiệm thuần túy về khám phá thuật toán thay vì tốc độ phần cứng thô.
Thử nghiệm hoạt động như thế nào
Mỗi mô hình trong số 18 mô hình được giao nhiệm vụ một cách tự động: đề xuất các thay đổi đối với công thức đào tạo, chạy thử nghiệm, kiểm tra kết quả và lặp lại — với một tập lệnh xác minh cố định và các hạt giống ngẫu nhiên cố định, đảm bảo rằng cải tiến được tuyên bố là có thật chứ không phải là một hoạt động may mắn. Như một nhà bình luận của Hacker News đã tóm tắt, các mô hình được yêu cầu nghiên cứu cách cải thiện quá trình đào tạo của một mô hình nhỏ, liên tục thử các thay đổi, kiểm tra chúng và sử dụng kết quả để quyết định nên thử gì tiếp theo.
Các mô hình đã hoạt động thông qua nhiều loại khai thác tác nhân — bao gồm mã claude, codex của OpenAI, kimi-code, grok-cli, qwen-code và tác nhân chính của Prime Intellect — và nhóm đã theo dõi mức tiêu thụ mã thông báo của mỗi lần chạy, số lượng thử nghiệm, lệnh gọi công cụ và thời gian đã trôi qua của tác nhân. Tổng cộng, thử nghiệm đã tiêu thụ hàng trăm triệu mã thông báo cho mỗi mô hình hàng đầu và hàng tỷ mã thông báo trên toàn bộ lưới.
Bảng xếp hạng: Fable 5 dẫn đầu gói
Kết quả tiêu đề: mô hình được xác định là Fable 5, chạy qua khai thác mã claude, đã thu hẹp 81,7% khoảng cách giữa công thức cơ bản và hồ sơ con người, với kết quả được xác thực tốt nhất là 2.726 trên số liệu của bảng xếp hạng. Để đạt được điều đó, mất 8,7 ngày thời gian tích lũy của đại lý, khoảng 800 triệu mã thông báo, 811 thử nghiệm và khoảng 3.000 lệnh gọi công cụ.
Nhóm rượt đuổi được dẫn đầu bởi Opus 5, đã thu hẹp 53,6% khoảng cách, theo sát là Kimi K3 với 52,2% khi được điều khiển bởi bộ khai thác tác nhân chính của Prime Intellect (và 45,8% thông qua mã kimi). Opus 4.8 quản lý 39,4 phần trăm, một số biến thể GPT-5.6 đạt khoảng 11 đến 36 phần trăm, Sonnet 5 đóng 26,8 phần trăm và Grok 4,5 và Qwen3.8 Max mỗi biến thể đạt khoảng 24,6 phần trăm.
Xa hơn nữa, DeepSeek V4 Pro đã thu hẹp khoảng cách 12,3%, GPT-5.5 đạt 8,1% và Kimi K2.7 cũ hơn hoàn thành ở mức 7,2%. Đáng chú ý, một mô hình được phát hành gần đây - GLM 5.3 - vẫn đang chạy tại thời điểm xuất bản mà chưa có hồ sơ xác thực nào, một lời nhắc nhở rằng điểm chuẩn sẽ trừng phạt những mô hình không thể xác thực những cải tiến của chính chúng một cách đáng tin cậy.
Tại sao nó lại quan trọng
Điểm chuẩn quan trọng vì chúng đo lường thứ mà bảng xếp hạng mã hóa không thể: khả năng chạy vòng nghiên cứu thực sự — giả thuyết, thử nghiệm, phân tích, sửa đổi — trong nhiều ngày thay vì vài phút. Khả năng đó là nền tảng của lĩnh vực nghiên cứu AI tự động mới nổi, trong đó các tác nhân được giao nhiệm vụ không phải viết mã theo thông số kỹ thuật mà khám phá những điều chưa ai cho họ xem.
Bản thân sự lan truyền của kết quả mang tính thông tin. Theo bài viết của dự án, hầu hết mọi mô hình trong thử nghiệm đều tìm thấy những ý tưởng chiến thắng cốt lõi giống nhau — yếu tố tách biệt các hoạt động tốt nhất là những gì thử nghiệm để lại: tác nhân mạnh hơn bảo toàn các tín hiệu yếu trong kết quả nhiễu đủ lâu để xác thực chúng và hiểu rõ hơn dữ liệu thử nghiệm của chính chúng.
Lời cảnh báo từ cộng đồng
Những người bình luận của Hacker News đã nêu lên những quan điểm về phương pháp luận một cách công bằng. Cài đặt nỗ lực và cách khai thác khác nhau giữa các mô hình - Fable 5 chạy ở cài đặt lý luận cao trong khi Opus 5 chạy ở mức tối đa - và số học của 153 lần chạy trên 18 mô hình cho thấy một số mô hình nhận được nhiều lần thử hơn các mô hình khác. Việc xếp hạng của một mẫu xe phản ánh khả năng nghiên cứu thô hay chất lượng của dây nịt vẫn là một câu hỏi mở.
Tuy nhiên, hướng đi vẫn rõ ràng. Khi những bàn tay nhanh nhất của con người phải mất nhiều năm nỗ lực tập thể để đạt được kỷ lục hiện tại, thì những tác nhân tự trị tốt nhất hiện đang thu hẹp phần lớn khoảng cách đó chỉ trong hơn một tuần thời gian tính toán. Câu hỏi tiếp theo – liệu mô hình nào có thể đóng được 18,3% còn lại hay không – có thể được trả lời sớm hơn dự kiến.
Để biết thêm về các điểm chuẩn và nghiên cứu định hình biên giới của AI, hãy theo dõi tin tức liên tục của AI Buzz Wire.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →