오픈 소스 프로젝트는 2,890만 개의 매개변수 언어 모델을 약 8달러짜리 마이크로컨트롤러에 압축하여 네트워크 연결 없이 초당 약 9개의 토큰으로 칩 전체에 텍스트를 생성했습니다. GitHub에 게시되고 Hacker News 첫 페이지에 빠르게 오르는 이 데모는 소규모 로컬 AI의 경계가 짧은 시간 내에 얼마나 멀리 이동했는지 보여줍니다.
작업은 취미생활자 및 하드웨어 제조업체에게 인기 있는 저렴한 임베디드 칩인 ESP32-S3에 중점을 두고 있습니다. 이렇게 작은 실리콘 조각에서 2,890만 개의 매개변수 모델을 실행하는 것은 얼마 전까지만 해도 불가능해 보였습니다. 이 프로젝트는 우리가 매일 AI 산업 보도에서 추적하는 온디바이스 AI를 향한 광범위한 추진을 생생하게 보여줍니다. 한때 클라우드가 실제 언어 모델에 필수라고 느꼈던 곳에서는 점점 더 성능이 향상되는 시스템이 가장자리에서 집을 찾고 있습니다.
빌드 뒤의 숫자
이 프로젝트는 사양을 명확하게 제시합니다. 이 모델은 2,890만 개의 매개변수를 저장하며 그 중 약 2,500만 개가 플래시 조회 테이블에 저장됩니다. 512KB 고속 SRAM, 8MB PSRAM 및 16MB 플래시 스토리지를 갖춘 ESP32-S3 칩에서 실행됩니다. 실제로는 초당 약 9.5개 토큰, 즉 순수 컴퓨팅의 경우 초당 9.7개 토큰에 도달하며, 전체 모델은 4비트 정밀도로 저장될 때 14.9MB만 차지합니다.
가장 눈에 띄는 것은 저자가 이전 작업과 비교한 것입니다. 이 클래스의 칩에서 실행되는 것으로 알려진 마지막 언어 모델은 260,000개의 매개변수만 보유했습니다. 새로운 빌드는 대략 100배 더 많은 용량을 보유하며 이는 더 큰 칩에서 비롯된 것이 아니라 모델의 데이터가 실제로 어디에 있는지 다시 생각하는 데서 비롯됩니다.
젬마에게서 빌린 기억법
핵심 문제는 마이크로 컨트롤러에 빠른 메모리가 거의 없다는 것입니다. ESP32-S3는 512KB의 SRAM만 제공하며 일반적으로 전체 모델은 여기에서 도달할 수 있어야 합니다. 이것이 바로 이전 시도가 수십만 개의 매개변수에서 중단된 이유입니다.
해결 방법은 간단한 관찰에 달려 있습니다. 언어 모델의 매개변수 대부분은 모델이 계산하는 대신 읽는 임베딩 테이블에 있습니다. 따라서 막대한 2,500만 행 테이블을 부족한 고속 메모리에 강제로 배치하는 대신 프로젝트에서는 이를 느린 플래시 스토리지에 남겨두고 각 토큰에 실제로 필요한 소수의 행(한 번에 약 450바이트)만 가져옵니다. 실제 계산을 수행하는 모델의 작은 부분은 빠른 메모리에 유지되는 반면, 가중치의 대부분은 한 번에 조금씩 샘플링되어 플래시에서 대기합니다.
이 기술은 레이어별 임베딩(Per-Layer Embedding)으로 알려져 있으며 Google의 Gemma 모델, 특히 휴대폰 및 GPU용으로 설계된 Gemma 3n 및 Gemma 4에서 시작되었습니다. 프로젝트 작성자에 따르면 이전에는 이렇게 작은 칩에 이러한 접근 방식을 시도한 사람이 아무도 없었습니다.
할 수 있는 것과 할 수 없는 것
이 모델은 간단한 동화의 데이터세트인 TinyStories에서 훈련되었기 때문에 의도적으로 그 능력을 좁혔습니다. 짧고 대부분 일관적인 이야기를 쓰지만, 사실적 질문에 답하거나, 복잡한 지침을 따르거나, 코드를 작성하거나, 세상에 대해 추론하지는 않습니다. 저자는 이러한 제한이 모델의 작은 추론 부분에서 비롯되며 메모리 트릭이 이를 변경하지 않는다는 점을 솔직하게 밝혔습니다.
따라서 프로젝트를 흥미롭게 만드는 것은 출력 품질이 아니라 아키텍처입니다. 이 성과는 이렇게 작은 칩에 이렇게 큰 모델을 장착하는 것이며, 휴대폰과 서버에서 효율적인 모델을 지원하는 동일한 기술을 샌드위치보다 저렴한 하드웨어에도 적용할 수 있음을 입증한 것입니다.
온디바이스 AI가 중요한 이유
그 의미는 깔끔한 기술 데모를 훨씬 넘어서는 것입니다. 모델은 전적으로 칩에서 실행되므로 아무 것도 서버로 전송되지 않습니다. 즉, 완전한 개인 정보 보호를 구축하고, 데이터가 장치 외부로 유출되지 않으며, 클라우드 비용을 지불할 필요가 없다는 것을 의미합니다. 원격 지역, 저전력 장치 또는 연결이 불안정한 환경의 애플리케이션의 경우 이러한 조합은 정말 유용합니다.
이는 또한 소규모의 특수 모델이 소수의 거대한 데이터 센터에 집중되기보다는 수십억 개의 저렴한 임베디드 장치에 분산되는 미래를 가리킵니다. 랩탑과 휴대폰의 로컬 AI에 대한 관심을 불러일으키는 동일한 압력, 즉 대기 시간 단축, 비용 절감, 개인 정보 보호 강화는 마이크로 컨트롤러 규모에서 더욱 강력하게 적용됩니다.
Tinker에 대한 공개 초대
이 프로젝트는 허용적인 MIT 라이센스에 따라 릴리스되었으며 작성자는 자세한 문서 및 벤치마크 결과와 함께 전체 코드를 GitHub에 공유했습니다. 이러한 개방성은 다른 하드웨어 개발자가 접근 방식을 연구하고 이를 다른 칩에 적용하거나 매개변수 수를 훨씬 더 높일 수 있음을 의미합니다.
slvDev라는 이름으로 출시된 이 작업은 개발자 커뮤니티에서 강력한 반향을 불러일으켰고 Hacker News에서 수백 개의 찬성표를 얻었으며 이 기술이 다음에 어디로 나아갈지에 대한 논의를 촉발했습니다. 이러한 추세가 지속된다면 "언어 모델"과 일반적인 임베디드 소프트웨어 사이의 경계는 훨씬 더 모호해질 것입니다.
AI보다 앞서 나가세요
8달러짜리 칩부터 수십억 달러 규모의 데이터 센터에 이르기까지, AI가 어디에서 실행되는지에 대한 문제는 AI가 무엇을 할 수 있는지만큼 중요해지고 있습니다. 하드웨어 계층은 대부분의 사람들이 인식하는 것보다 더 빠르게 발전하고 있으며, 오늘날에는 신기해 보이는 프로젝트가 미래의 주류를 정의하는 경우가 많습니다. AI Buzz Wire에서 더 많은 AI 뉴스를 읽어보세요. 엣지 컴퓨팅, 모델 효율성, 온디바이스 인텔리전스의 모든 혁신을 따라가세요.
AI 하드웨어 혁명에 발맞추기 - AI Buzz Wire를 방문하세요


