분산형 AI 연구소 Prime Intellect는 오늘날의 최첨단 AI 모델이 자율적 기계 학습 연구를 얼마나 잘 수행할 수 있는지 테스트하는 대규모 실험 결과를 발표했습니다. 그 중 최고는 유명한 커뮤니티 벤치마크에서 인간 세계 기록과 매우 근접했습니다.
NanoGPT Speedrun Frontier라고 명명되고 8월 22일에 발표된 이 프로젝트는 nanoGPT 최적화기 speedrun을 시도하는 18개 프론티어 모델에 걸쳐 153개의 자율 실행으로 구성되었습니다. 이 경쟁은 연구자들이 작은 언어 모델을 고정된 품질 목표로 훈련시키는 가장 효율적인 방법을 찾는 경쟁입니다. 이 이야기는 Hacker News의 첫 페이지에 빠르게 올라갔고, AI의 진정한 과학적 발견 능력에 대해 결과가 말하는 바를 토론하는 수십 개의 댓글이 달렸습니다. 이 이야기에 대한 자세한 내용은 인공지능 뉴스를 참조하세요.
NanoGPT Speedrun은 실제로 무엇인가요?
벤치마크는 Keller Jordan이 관리하는 modded-nanogpt 저장소와 다양한 커뮤니티 기여자 목록에서 나온 것입니다. 도전 과제는 믿을 수 없을 정도로 간단합니다. 8개의 NVIDIA H100 GPU를 사용하여 FineWeb 검증 세트에서 3.28 교차 엔트로피 손실에 도달하는 언어 모델을 훈련합니다. 이는 Andrej Karpathy의 원래 GPT-2 복제가 45분 후에 도달한 성능 수준입니다.
지난 2년 동안 수백 건의 커뮤니티 기여를 통해 인간 기록은 75초 미만, 훈련 토큰 4억 개 미만으로 단축되었으며, 이는 원래 레시피보다 30배 이상 향상된 것입니다. 성공적인 솔루션은 Muon 옵티마이저, QK-Norm을 사용한 회전식 임베딩, ReLU 제곱 활성화, 어텐션 및 MLP 패스에 대한 FP8 양자화, 슬라이딩 윈도우 패턴을 사용한 Flash Attention 3 및 서로 겹쳐진 수십 가지 기타 기술 등 현대 ML 엔지니어링의 카탈로그처럼 읽혀집니다.
Prime Intellect의 테스트에서는 벤치마크의 최적화 트랙을 사용했습니다. 이는 저장소 문서에 따라 사실상 무제한의 벽시계 예산으로 고정된 아키텍처, 데이터 세트 및 배치 크기에 따라 목표 손실을 달성하는 데 필요한 교육 단계 수를 최소화합니다. 이는 원시 하드웨어 속도가 아닌 알고리즘 검색에 대한 순수한 테스트가 됩니다.
실험의 진행 방식
18개 모델 각각에는 훈련 레시피 변경 제안, 실험 실행, 결과 검사 및 반복이라는 작업이 자율적으로 주어졌습니다. 고정된 검증 스크립트와 고정된 무작위 시드를 사용하여 주장된 개선이 행운이 아닌 실제임을 보장합니다. 한 Hacker News 논평자가 요약한 것처럼, 모델은 소규모 모델의 훈련을 개선하는 방법을 연구하고, 변경 사항을 반복적으로 시도하고, 테스트하고, 결과를 사용하여 다음에 무엇을 시도할지 결정하도록 요청 받았습니다.
모델은 clude-code, OpenAI의 코덱스, kimi-code, grok-cli, qwen-code 및 Prime Intellect의 자체 프라임 에이전트를 포함한 다양한 에이전트 하네스를 통해 작동했으며 팀은 모든 실행의 토큰 소비, 실험 횟수, 도구 호출 및 에이전트 경과 시간을 추적했습니다. 전체적으로 이 실험에서는 상위 모델당 수억 개의 토큰이 소비되었고 전체 그리드에서는 수십억 개가 소비되었습니다.
리더보드: Fable 5가 선두를 달리고 있습니다.
헤드라인 결과: 클로드 코드 하네스를 통해 실행되는 Fable 5로 식별된 모델은 기준 레시피와 인간 기록 사이의 격차를 81.7% 줄였으며 리더보드 지표에서 가장 검증된 결과는 2,726이었습니다. 거기까지 가는 데 누적 에이전트 시간이 8.7일, 대략 8억 개의 토큰, 811번의 실험, 약 3,000번의 도구 호출이 걸렸습니다.
추격 팩은 Opus 5가 주도하여 53.6%의 격차를 좁혔고, Prime Intellect의 프라임 에이전트 하니스로 구동할 때 Kimi K3가 52.2%(Kimi-code를 통해 45.8%)로 그 뒤를 이었습니다. Opus 4.8은 39.4%를 관리했고, 여러 GPT-5.6 변형은 대략 11~36% 사이에 도달했으며, Sonnet 5는 26.8%를 마감했으며, Grok 4.5와 Qwen3.8 Max는 각각 약 24.6%에 도달했습니다.
더 나아가 DeepSeek V4 Pro는 격차의 12.3%를 좁혔고, GPT-5.5는 8.1%, 구형 Kimi K2.7은 7.2%를 기록했습니다. 특히 최근 출시된 모델 중 하나인 GLM 5.3은 게시 시점에 아직 검증된 기록 없이 실행 중이었습니다. 이는 벤치마크가 자체 개선 사항을 안정적으로 검증할 수 없는 모델을 처벌한다는 점을 상기시켜 줍니다.
중요한 이유
이와 같은 벤치마크는 코딩 순위표가 할 수 없는 것을 측정하기 때문에 중요합니다. 즉, 몇 분이 아닌 며칠에 걸쳐 진정한 연구 루프(가설, 실험, 분석, 수정)를 실행하는 능력입니다. 이 기능은 에이전트가 사양에 맞게 코드를 작성하는 것이 아니라 아무도 보여주지 않은 것을 발견하는 임무를 맡은 자율 AI 연구라는 새로운 분야의 기초입니다.
결과의 확산은 그 자체로 유익합니다. 프로젝트 기록에 따르면 실험의 거의 모든 모델은 동일한 핵심 승리 아이디어를 찾았습니다. 최고의 실행을 구분하는 것은 실험이 남긴 것입니다. 더 강한 에이전트는 시끄러운 결과에서 약한 신호를 검증할 수 있을 만큼 오랫동안 보존하고 자체 실험 데이터를 더 잘 이해했습니다.
커뮤니티의 주의사항
Hacker News 논평자들은 공정한 방법론적 요점을 제기했습니다. 노력 설정과 하네스는 모델에 따라 다양했습니다. Fable 5는 높은 추론 설정에서 실행된 반면 Opus 5는 최대로 실행되었습니다. 18개 모델에서 153회 실행이라는 산술은 일부 모델이 다른 모델보다 더 많은 시도를 받았음을 의미합니다. 모델의 순위가 원시 연구 능력을 반영하는지, 아니면 하네스의 품질을 반영하는지 여부는 아직 공개된 질문으로 남아 있습니다.
그럼에도 여행의 방향은 분명하다. 가장 빠른 인간의 손이 현재 기록에 도달하기 위해 수년간의 공동 노력이 필요했을 때, 최고의 자율 에이전트는 이제 일주일이 조금 넘는 컴퓨팅 시간 내에 그 격차의 대부분을 메우고 있습니다. 다음 질문인 어떤 모델이 나머지 18.3%를 마감할 수 있는지 여부는 예상보다 빨리 답변될 수 있습니다.
AI의 경계를 형성하는 벤치마크 및 연구에 대한 자세한 내용을 보려면 AI Buzz Wire의 지속적인 보도를 따르십시오.
---
AI 최신 소식최신 AI 뉴스, 분석 및 혁신을 한 곳에서 확인하세요.
AI 뉴스 더 보기 →