기계 학습의 완고한 한계 중 하나인 학습을 멈추지 않는 언어 모델 구축을 해결하기 위한 새로운 오픈 소스 프로젝트가 주목을 받고 있습니다. mini-AGI라고 불리는 이 프로젝트는 자체 아키텍처를 조립하고 8GB VRAM이 있는 단일 GPU에서 처음부터 훈련하며 읽는 모든 것에서 계속 학습하는 지속적인 학습, 바이트 수준 언어 모델로 설명됩니다.

이 프로젝트는 주말 동안 Hacker News에 게재되어 포인트가 100개가 훨씬 넘었고 GitHub의 저장소는 MIT 라이센스에 따라 출시되었습니다. 프로젝트의 README에 따르면, 목표는 일반 소비자급 하드웨어에서도 심각한 망각 없이 단일 데이터 스트림에서 지속적인 학습이 가능하다는 것을 입증하는 것입니다. 이 이야기에 대한 자세한 내용은 인공지능 뉴스를 참조하세요.

VRAM이 아닌 디스크의 무게

mini-AGI의 핵심 비결은 틀에 얽매이지 않는 메모리 관리 체계입니다. 모든 모델 매개변수를 GPU 메모리에 보관하는 대신 시스템은 가중치를 디스크에 일반 파일로 저장하고 필요할 때 그래픽 카드에 페이징합니다.

이러한 설계 선택은 중요한 결과를 가져옵니다. 모델의 매개변수 개수는 VRAM이 아닌 여유 디스크 공간으로 제한됩니다. README에는 모델이 부족할 때 훈련하는 동안 새로운 용량을 늘릴 수 있고 아무것도 요구하지 않는 용량을 정리할 수 있다고 명시되어 있습니다. 훈련과 추론은 정확히 동일한 코드 경로를 통해 실행되므로 별도의 미세 조정 체제나 고정된 기본 모델이 없습니다. 프로젝트에 따르면 읽기와 훈련은 동일한 이벤트입니다.

이 시스템은 많은 개발자가 이미 소유하고 있는 하드웨어인 최소 8GB VRAM GPU를 갖춘 PC 또는 노트북을 대상으로 합니다.

지속적인 학습이 어려운 이유

오늘날 사용 가능한 대부분의 언어 모델은 동일한 수명 주기를 따릅니다. 즉, 연구실에서는 모델을 훈련하고, 동결하고, 배송합니다. 사용자는 가장자리 주위를 미세 조정할 수 있지만 기본 가중치는 다시 변경되지 않습니다. 프로젝트의 동기부여 섹션에서는 이것이 모든 개인 소유 모델을 "맨 위에 얇은 층이 있는 다른 사람의 모델"로 만든다고 주장합니다. 즉, 출시되는 날 학습을 중단하는 모델입니다.

장애물은 기계 학습 연구에서 잘 알려진 것입니다. 즉, 치명적인 망각, 즉 새로운 데이터에 대해 훈련할 때 이전에 학습한 지식을 덮어쓰는 신경망의 경향입니다. 일상적인 정보 흐름을 통해 지속적으로 학습하는 모델은 일반적으로 이전에 알고 있던 모든 정보의 수준이 저하됩니다.

README에는 디자인을 구성하는 제약 조건이 간략하게 설명되어 있습니다. 모델은 양자화가 아닌 8GB VRAM에 적합해야 합니다. 훈련에는 가중치 자체 메모리의 약 3배를 추가하는 기울기와 최적화 상태가 필요하기 때문입니다. 그리고 끝없이 이어지는 텍스트 흐름에서 새로운 자료를 흡수하면서 이미 배운 내용을 붙잡고 잊어서는 안 됩니다.

스스로 구축되는 바이트 수준 모델

mini-AGI는 토큰이 아닌 바이트 수준에서 작동하여 한 번에 한 청크씩 문자 스트림을 읽고 각 청크에 대해 그라데이션 단계를 수행합니다. 이 프로젝트는 또한 모델이 훈련이 시작되기 전에 제작자가 구조를 수정하는 기존 모델과 구별되는 "자체 아키텍처를 조립"한다고 말합니다.

접근 방식은 의도적으로 실험적입니다. 이는 프론티어 시스템에 대한 도전이 아니라 훈련 체제에 대한 소규모 시연입니다.

중요 주의사항

프로젝트 작성자는 시스템의 현재 상태를 명시적으로 설명합니다. README 자체의 표현에 따르면 mini-AGI는 "작은 장난감 수준 모델"이므로 독자는 최첨단 수준의 기능을 기대해서는 안 됩니다. 연습의 요점은 심각한 망각 없이 단일 데이터 스트림에서 지속적인 학습이 가능하며 거의 모든 사람이 액세스할 수 있는 하드웨어에서 가능하다는 것을 보여주는 것입니다.

모델의 가중치는 아직 공개되지 않았습니다. 훈련 실행은 여전히 ​​학습 중인 코퍼스에 대한 첫 번째 패스를 완료하는 중이며 저자는 해당 패스가 완료되면 가중치가 해제될 것이라고 말하는데, 현재 속도로는 2주 정도 걸립니다. 그때까지 관찰자는 프로젝트 페이지의 훈련 실행 기록에서 샘플을 검사하여 읽기 과정에서 모델이 어떻게 개선되었는지 확인할 수 있습니다.

그것이 중요한 이유

모델이 더 많은 가능한 크기로 확장됨에 따라 이 접근 방식이 유지된다면 이는 다른 종류의 AI 소유권을 의미합니다. 즉, 자신의 컴퓨터에 살고, 제공한 문서와 데이터를 통해 계속 학습하며, 공급업체의 출시 일정에 따라 가중치가 고정되지 않는 개인 모델입니다.

이 프로젝트는 또한 AI의 모든 흥미로운 작업이 개척지에서 일어나는 것은 아니라는 사실을 상기시켜 줍니다. 단일 소비자 GPU, 일반 디스크 공간 및 MIT 라이센스를 사용하여 mini-AGI는 대규모 연구실이 대부분 회피했던 질문, 즉 사람들이 수행하는 방식을 학습하기 위해 모델을 구축할 수 있는지 여부에 대한 답을 시도하고 있습니다.

코드와 문서는 호환되는 하드웨어를 사용하여 프로젝트를 따르거나 포크하거나 적절하다고 판단되는 모델 교육을 계속하려는 모든 사람이 GitHub에서 사용할 수 있습니다.

---

AI 최신 소식

최신 AI 뉴스, 분석 및 혁신을 한 곳에서 확인하세요.

AI 뉴스 더 보기 →