Điều gì xảy ra khi một mô hình ngôn ngữ lớn không bao giờ nhìn thấy tài liệu ngoài lớp năm? Một nhóm gồm bảy nhà nghiên cứu đã trả lời câu hỏi đó theo đúng nghĩa đen: họ đã xây dựng LittleLearner, một LLM gồm 5 tỷ tham số được đào tạo từ đầu trên kho ngữ liệu được lọc theo chương trình giảng dạy ở trường tiểu học của Hoa Kỳ, sau đó kiểm tra xem liệu bất kỳ điều gì — nhiều tham số hơn, nhiều thông số sau đào tạo hơn, lời nhắc thông minh hơn — có thể đẩy mô hình vượt qua những gì mà dữ liệu đào tạo trước đã dạy nó hay không. Câu trả lời, họ báo cáo, là không.
Bài báo "LittleLearner: Các mô hình ngôn ngữ dưới sự tiếp xúc với kiến thức được kiểm soát bằng phương pháp sư phạm" đã được Fanfei Li, Jana Zeller, Manuel Prada-Corral, Thaddäus Wiedemer, Prasanna Mayilvahanan, Ryan Cotterell và Wieland Brendel đệ trình lên arXiv vào ngày 13 tháng 8. Đến ngày 16 tháng 8, nó đã trở thành chủ đề của cuộc thảo luận trên Hacker News tăng nhanh với hơn 200 lượt tán thành, khi các nhà nghiên cứu và học viên tranh luận về ý nghĩa của giả định được ưa thích trong ngành — rằng đào tạo sau có thể gợi lên các khả năng bất ngờ. Đó chính xác là loại thử nghiệm trái ngược, cẩn thận mà chúng tôi theo dõi trong phạm vi nghiên cứu AI.
Hộp cát có đường viền kiến thức
LLM hiện đại về cơ bản được đào tạo về mọi thứ, điều này khiến gần như không thể biết liệu một kỹ năng đã được chứng minh có thực sự được học trong quá trình đào tạo hay chỉ đơn thuần được gợi ra bởi lời nhắc phù hợp. Giải pháp của nhóm là hạn chế việc phân bổ đào tạo. Bắt đầu từ FineWeb-Edu, họ đã chắt lọc kho dữ liệu trị giá 88 tỷ mã thông báo — được đặt tên là LittleCurriculum — thông qua quy trình lọc gồm 5 giai đoạn phù hợp với các tiêu chuẩn Common Core dành cho mẫu giáo đến lớp 5. Các khái niệm, dữ kiện và từ vựng được dạy trên lớp 5 đã bị loại trừ rõ ràng.
Trên kho dữ liệu này, họ đã huấn luyện các mô hình ở ba thang đo (tham số 0,6B, 1,3B và 5B) từ đầu, mỗi thang đo được vận chuyển cùng với một mô hình kiểm soát phù hợp được huấn luyện trên dữ liệu chưa được lọc với cùng kiến trúc và ngân sách mã thông báo. Kết quả là một mô hình đủ trôi chảy để đánh giá mở - bạn có thể trò chuyện với phiên bản 5B được lưu trữ trong trình duyệt - nhưng vẫn có ranh giới kiến thức rõ ràng, dễ hiểu: nếu nó không có trong chương trình giảng dạy tiểu học thì mô hình sẽ không bao giờ nhìn thấy nó.
Khơi dậy chứ không phải mua lại
Phát hiện cốt lõi rất rõ ràng: bộ công cụ tiêu chuẩn để làm cho các mô hình trở nên thông minh hơn đã khuếch đại những gì LittleLearner đã biết, nhưng không có bộ công cụ nào trong số đó cải thiện đáng kể hiệu suất ngoài phạm vi.
Chia tỷ lệ đã cải thiện độ chính xác trong phạm vi kiến thức được kiểm soát của mô hình và mở rộng một cách khiêm tốn theo cùng một lộ trình học tập, nhưng hầu như không giải quyết được các vấn đề đòi hỏi khả năng ngoài tài liệu lớp 5. Đào tạo sau với GRPO — phương pháp học tập củng cố đằng sau phần lớn sự bùng nổ của mô hình lý luận — đã tăng cường đáng kể các khả năng của K-5 trong phạm vi, nhưng không thể phục hồi các khả năng ngoài K-5 ngay cả khi được đào tạo với dữ liệu ngoài phạm vi. Và học trong ngữ cảnh, phép thuật hàng ngày của việc nhồi nhét kiến thức vào lời nhắc, đã giúp mô hình sử dụng những gì nó có nhưng không mở ra được lý luận mới vượt ra ngoài ranh giới.Tóm lại, bộ lọc huấn luyện trước đặt ra mức trần công suất hiệu quả. Các tác giả coi kết quả là bằng chứng cho sự khác biệt mà lĩnh vực này liên tục làm mờ: gợi ý sau đào tạo và nhắc nhở; đào tạo trước có được.
Kiểm soát sạch, Điểm kiểm tra công cộng
Phương pháp luận là yếu tố mang lại sức thuyết phục cho các tuyên bố. Bởi vì mọi mô hình LittleLearner đều có một điều khiển không được lọc phù hợp — cùng một kiến trúc, cùng số lượng mã thông báo, cùng một công thức đào tạo — nên nhóm có thể quy bất kỳ sự khác biệt về hành vi nào cho riêng bộ lọc chương trình giảng dạy. Các chuyên gia toán học được đào tạo sau về điểm chuẩn MathCAMPS cho phép các nhà nghiên cứu chấm điểm hiệu suất theo cấp trường, truy tìm chính xác điểm kết thúc của khả năng trong phạm vi. Và không giống như hầu hết các bài báo biên giới, mọi thứ đều được công khai: kho dữ liệu, cơ sở và các điểm kiểm tra sau đào tạo ở cả ba thang đo trên HuggingFace và bản demo trò chuyện được lưu trữ để các nhóm độc lập có thể tự mình thăm dò ranh giới.
Sự cởi mở đó đang thúc đẩy cuộc tranh luận về Hacker News. Những người bình luận đã kiểm tra hành vi của mô hình được lưu trữ ở rìa kiến thức của nó — cho dù nó kiêng, đoán hay ảo giác khi vượt qua lớp 5 — và tranh luận về những tác động: một số coi kết quả là tin xấu cho sự cường điệu của mô hình lý luận, những người khác chỉ ra rằng dữ liệu đào tạo trước trên quy mô web chứa nhiều thứ hơn là các khái niệm ở trường tiểu học, do đó, trần của các mô hình biên giới tương ứng cao hơn. Bản thân các tác giả của bài báo cũng rất cẩn thận về điểm này: tuyên bố của họ là về những gì mà các biện pháp can thiệp tiêu chuẩn không thể làm được đối với một mô hình có nền giáo dục được kiểm soát và đã biết, chứ không phải là dự đoán trực tiếp về các phòng thí nghiệm biên giới.
Tại sao nó lại quan trọng ngoài lớp học
Thí nghiệm nói trực tiếp đến các cuộc tranh luận trực tiếp về AI. Các phòng thí nghiệm AI chi hàng tỷ USD cho các chế độ sau đào tạo dựa trên ý tưởng rằng học tăng cường có thể đẩy mô hình cơ sở vượt xa khả năng thô của nó. LittleLearner gợi ý rằng những lợi ích đó phần lớn có thể nằm trong — và bị giới hạn bởi — những gì dữ liệu đào tạo trước hỗ trợ. Đó là lập luận ủng hộ việc quan tâm nhiều hơn đến việc quản lý dữ liệu và xử lý các tuyên bố về khả năng sau đào tạo "nổi lên" bằng thái độ hoài nghi.
Bản phát hành còn là một công cụ nghiên cứu đích thực chứ không chỉ là một bài báo. Nhóm đã phát hành LittleCurriculum và tất cả các điểm kiểm tra mô hình một cách công khai, đồng thời trang dự án phác thảo các thử nghiệm mà hộp cát cho phép: liệu RL có thể thực sự tạo ra khả năng thay vì thưởng cho nó hay không, làm thế nào một mô hình học một khái niệm thực sự mới như số âm khi nó được giới thiệu và liệu máy móc và trẻ em có cần tiếp xúc tương tự — hoặc mắc lỗi tương tự — khi học phân số hay không.
Đối với một lĩnh vực hiếm khi có được sự kiểm soát rõ ràng, một mô hình có trình độ học vấn được chỉ định rõ ràng là một món quà hiếm có. Và đối với những người khác, đó là một lời nhắc nhở đáng được ghim phía trên bàn làm việc: không một người mẫu nào - hoặc một người nào - có thể lý luận theo cách mà họ chưa từng được dạy.
Đi trước AI
Báo cáo cấp độ đánh giá ngang hàng về nghiên cứu định hình lại AI, được cung cấp hàng ngày. Đánh dấu trung tâm của chúng tôi để biết những phát triển AI mới nhất.
Đọc thêm tin tức về AI →