Một dự án nguồn mở mới đang thu hút sự chú ý nhờ giải quyết một trong những hạn chế cứng đầu của học máy: xây dựng một mô hình ngôn ngữ không bao giờ ngừng học. Được gọi là mini-AGI, dự án tự mô tả là một mô hình ngôn ngữ cấp byte, học tập liên tục, lắp ráp kiến ​​trúc của riêng nó, đào tạo từ đầu trên một GPU duy nhất với 8GB VRAM và tiếp tục học hỏi từ mọi thứ nó đọc.

Dự án đã xuất hiện trên Hacker News vào cuối tuần qua, nơi nó đã leo lên hơn một trăm điểm và kho lưu trữ của nó trên GitHub được phát hành theo giấy phép MIT. Theo README của dự án, mục tiêu là để chứng minh rằng việc học liên tục từ một luồng dữ liệu duy nhất - mà không bị quên một cách nghiêm trọng - có thể thực hiện được ngay cả trên phần cứng cấp độ tiêu dùng khiêm tốn. For more context on this story, see our ongoing breaking AI news.

Trọng lượng trên đĩa, không phải trong VRAM

Thủ thuật trung tâm đằng sau mini-AGI là một sơ đồ quản lý bộ nhớ độc đáo. Thay vì giữ tất cả các tham số mô hình trong bộ nhớ GPU, hệ thống sẽ lưu trữ trọng lượng của nó dưới dạng các tệp thông thường trên đĩa và lưu chúng vào card đồ họa khi cần thiết.

Lựa chọn thiết kế đó có một hệ quả đáng kể: số lượng tham số của mô hình bị giới hạn bởi dung lượng đĩa trống thay vì VRAM. README tuyên bố rằng mô hình có thể phát triển năng lực mới trong khi đào tạo khi thiếu năng lực và cắt giảm năng lực không yêu cầu. Quá trình đào tạo và suy luận diễn ra theo cùng một đường dẫn mã, do đó không có chế độ tinh chỉnh riêng biệt và không có mô hình cơ sở cố định — việc đọc và được đào tạo, theo cách nói của dự án, là cùng một sự kiện.

Hệ thống này nhắm đến PC hoặc máy tính xách tay có GPU VRAM ít nhất 8GB, phần cứng mà nhiều nhà phát triển đã sở hữu.

##Tại sao việc học liên tục lại khó

Hầu hết các mô hình ngôn ngữ hiện có ngày nay đều tuân theo cùng một vòng đời: phòng thí nghiệm đào tạo một mô hình, đóng băng và vận chuyển nó. Người dùng có thể tinh chỉnh xung quanh các cạnh nhưng trọng lượng cơ bản không bao giờ thay đổi nữa. Phần động lực của dự án lập luận rằng điều này khiến mọi mô hình thuộc sở hữu cá nhân trở thành "mô hình của người khác với một lớp mỏng của bạn ở trên" - một mô hình sẽ ngừng học hỏi vào ngày nó xuất xưởng.

Trở ngại là một trở ngại nổi tiếng trong nghiên cứu học máy: sự quên lãng nghiêm trọng, xu hướng mạng lưới thần kinh ghi đè lên kiến ​​thức đã học trước đó khi được đào tạo trên dữ liệu mới. Một mô hình học hỏi liên tục từ luồng thông tin hàng ngày thường làm suy giảm mọi thứ nó biết trước đó.

README phác thảo những hạn chế đã hình thành nên thiết kế. Mô hình phải phù hợp với 8GB VRAM — không phải với lượng tử hóa, vì quá trình đào tạo yêu cầu độ dốc và trạng thái tối ưu hóa giúp tăng thêm khoảng ba lần bộ nhớ của trọng số. Và nó không được quên, nắm giữ những gì nó đã học được trong khi tiếp thu tài liệu mới từ dòng văn bản bất tận.

Mô hình cấp byte tự xây dựng

mini-AGI hoạt động ở cấp độ byte thay vì trên mã thông báo, đọc một luồng ký tự từng đoạn một và thực hiện bước chuyển màu trên mỗi đoạn. Dự án cũng cho biết mô hình này "lắp ráp kiến ​​trúc của riêng nó", phân biệt nó với các mô hình thông thường có cấu trúc được người tạo ra cố định trước khi bắt đầu đào tạo.

Cách tiếp cận này mang tính thử nghiệm có chủ ý. Đây là một cuộc trình diễn quy mô nhỏ về chế độ đào tạo, không phải là một thách thức đối với các hệ thống biên giới.

Những lưu ý quan trọng

Tác giả của dự án trình bày rõ ràng về trạng thái hiện tại của hệ thống. Theo cách nói riêng của README, mini-AGI là "một mô hình cấp độ đồ chơi nhỏ" và người đọc không nên mong đợi những khả năng ở cấp độ biên giới. Mục đích của bài tập là chỉ ra rằng việc học liên tục từ một luồng dữ liệu duy nhất mà không bị quên nghiêm trọng là hoàn toàn có thể - và có thể thực hiện được trên phần cứng mà hầu hết mọi người đều có thể truy cập.

Trọng lượng của mô hình vẫn chưa được công bố. Quá trình huấn luyện vẫn đang hoàn thành lần vượt qua kho ngữ liệu đầu tiên mà nó đang học và tác giả cho biết các trọng số sẽ được giải phóng sau khi quá trình đó hoàn tất, với tốc độ hiện tại là còn vài tuần nữa. Cho đến lúc đó, người quan sát có thể kiểm tra các mẫu từ lịch sử quá trình đào tạo trên trang dự án để xem mô hình đã được cải thiện như thế nào trong quá trình đọc.

Tại sao nó lại quan trọng

Nếu cách tiếp cận này được duy trì khi mô hình mở rộng đến các kích thước phù hợp hơn, thì nó sẽ hướng tới một loại quyền sở hữu AI khác: các mô hình cá nhân hoạt động trên máy của chính bạn, tiếp tục học hỏi từ các tài liệu và dữ liệu bạn cung cấp cho chúng và không bao giờ bị đóng băng trọng lượng của chúng theo lịch phát hành của nhà cung cấp.

Dự án cũng là một lời nhắc nhở rằng không phải tất cả công việc thú vị về AI đều diễn ra ở tuyến đầu. Với một GPU tiêu dùng duy nhất, dung lượng ổ đĩa thông thường và giấy phép MIT, mini-AGI đang cố gắng trả lời một câu hỏi mà các phòng thí nghiệm lớn phần lớn đã bỏ qua – liệu một mô hình có thể được xây dựng để học theo cách mọi người làm: liên tục, từ bất cứ điều gì nó gặp phải tiếp theo hay không.

Mã và tài liệu có sẵn trên GitHub cho bất kỳ ai có phần cứng tương thích muốn theo dõi, phân nhánh dự án hoặc tiếp tục đào tạo mô hình khi họ thấy phù hợp.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →