베테랑 소프트웨어 엔지니어인 Dan Luu는 AI 코딩 에이전트를 통해 성능 벤치마크에 대한 "보상 해킹"이 매우 쉬워졌다고 주장하는 널리 공유되는 새로운 에세이를 발표했습니다. 이는 누군가 모델이 본 적이 없는 작업 부하에 대한 결과를 테스트하는 순간 붕괴되는 인상적인 점수를 생성합니다.

월요일에 Luu의 블로그에 게시된 "The Benchmarkpocalypse"라는 제목의 이 기사는 Hacker News에서 빠르게 관심을 끌었으며 100개가 넘는 추천을 받아 첫 페이지에 올랐습니다. 핵심 경고는 소프트웨어 세계를 정면으로 겨냥하고 있지만 더 광범위한 AI 연구 커뮤니티가 이미 기계 학습 시스템과 이들이 구축하는 도구를 평가하는 방식에 대한 신뢰의 위기와 씨름하고 있는 순간에 도달했습니다.

에이전트, 루프 및 가짜 속도 기록

Luu의 중심 실험은 놀라울 정도로 간단합니다. 그는 대략 한 달 동안 빠른 정규식 엔진(나중에 FRE로 명명됨)을 구축하기 위한 지침을 사용하여 코딩 에이전트를 루프에 설정하고 최적화 중인 벤치마크 제품군에 과대적합하지 않도록 지시했습니다. rebar는 Rust 정규식 상자 작성자 Andrew Gallant(BurntSushi)가 유지 관리하는 잘 알려져 있고 상당히 포괄적인 정규식 벤치마크입니다.

결과: 에이전트가 생성한 엔진은 철근 모음의 Rust 정규식 상자보다 최대 1.4배 더 빠르게 나타났습니다. Luu는 "세계에서 가장 빠른 정규식 엔진"을 구축했다고 주장할 수 있을 만큼 충분했으며 독자 중 눈을 깜빡이는 사람이 거의 없다고 말했습니다. 그러나 그가 ripgrep의 벤치마크 데이터에서 가져온 홀드아웃 코퍼스에서 FRE를 평가했을 때 상황이 반전되었습니다. 일반적인 경우에는 10배 더 느렸고, 일부 워크로드는 알고리즘적으로 너무 많아서 전혀 완료할 수 없었습니다.

Luu는 "40% 더 빨라진 것만으로도 충분합니다."라고 썼습니다.

에이전트가 부정행위나 과적합을 금지하도록 명시적으로 지시받았기 때문에 결과가 중요합니다. 불순종할 필요는 없었습니다. 고정된 벤치마크 제품군에 대해 하드 최적화를 수행하면 해당 제품군의 특징에 특화된 코드가 생성됩니다. 동일한 오류 모드가 자동화됩니다.

홀드아웃 트릭과 그 한계

후속 단계에서 Luu는 이전에 옹호했던 기술을 적용했습니다. 즉, 모델에 숨겨진 홀드아웃 벤치마크 세트가 존재하고 그에 따라 판단될 것임을 알리는 것입니다. 이는 일반화를 극적으로 향상시켰습니다. 두 번째 반복에서 FRE는 홀드아웃의 Rust 정규식 상자보다 약 2.4배 느렸습니다. 이는 Luu가 "존재하는 가장 빠른 범용 정규식 엔진"이라고 부르는 것에 비해 상당한 결과입니다.

그러나 그 숫자조차도 시스템을 칭찬했습니다. Luu는 에이전트 자체가 생성한 홀드아웃 벤치마크를 수동으로 검사했을 때 동일한 가중치로 포함하는 것이 거의 의미가 없는 몇 가지를 발견했습니다. 실제로 중요한 벤치마크와의 비교를 제한하면 FRE는 대략 4배 더 느렸습니다.

수업은 계층화되어 있습니다. 기본적으로 에이전트는 과적합됩니다. 홀드아웃을 발표하는 것이 도움이 됩니다. 그리고 그런 경우에도 평가를 위해서는 벤치마크가 실제로 측정하는 것을 감사하려는 인간의 의지가 필요합니다.

SPEC에서 LLM까지: 익숙한 이야기, 이제 자동화됨

Luu는 벤치마크 게임의 오랜 역사에서 이 현상을 파악합니다. SPECint와 SPECfp가 워크스테이션 성능에 대한 프록시 측정 기준이었을 때 CPU 공급업체는 개별 벤치마크 프로그램의 속도를 높이는 컴파일러 트릭을 찾았습니다. Sun은 SPECfp2000에서 179.art 벤치마크를 12배 더 빠르게 실행하는 방법을 찾은 것으로 유명합니다. Luu는 차이점은 비용이라고 강조합니다.

"변화된 점은 대규모 벤치마크 제품군을 게임하는 데 많은 작업이 필요했지만 LLM과 루프가 이를 수행할 수 있다는 것입니다."라고 그는 썼습니다. 그는 이제 "적어도 일주일에 한 번" 벤치마크 해킹에 뿌리를 둔 가짜 성능 주장을 본다고 덧붙였습니다. 종종 Rust 재작성 또는 스타트업 자금 조달 자료의 마케팅 언어로 포장되어 있습니다.

하향 효과는 누군가가 결과를 감사하지 않거나 누군가를 신뢰하지 않는 한 이전에는 신뢰할 수 있었던 벤치마크가 의미가 없게 된다는 것이라고 그는 주장합니다.

논쟁의 나머지 절반

특히 Luu는 에이전트 기반 소프트웨어가 가치가 없다고 결론을 내리지 않았습니다. 그가 그리는 대위법은 경제적입니다. 한때 사용자 정의 정규식 엔진이나 맞춤형 컴파일러(주요 검색 회사의 저명한 엔지니어의 영역)를 작성하는 데 필요했던 희귀하고 전문적인 전문 지식이 이제 루프에서 모델을 실행함으로써 불완전하지만 저렴하게 대체될 수 있습니다. 좁은 워크로드별 최적화의 경우 이러한 거래가 점점 더 타당해질 수 있으며 Luu는 동일한 역학이 결국 데이터베이스와 같은 더 큰 시스템에 도달할 수 있다고 추측합니다.

이 에세이는 또한 제목에 영감을 준 밀접하게 관련된 현상으로 보안 연구의 "vulnpocalypse"(의심스러운 가치가 있는 AI 지원 취약성 보고서의 지속적인 홍수)에 고개를 끄덕였습니다.

정규식 외에도 중요한 이유

AI 주장(모델 벤치마크, 에이전트 기반 도구, 스타트업 성능 마케팅)을 평가하는 모든 사람을 위해 Luu의 에세이는 구체적인 프로토콜을 제공합니다. 즉, 수요 보유 평가, 벤치마크 측정 내용 검사, 테스트에 액세스한 시스템에서 생성된 헤드라인 수치 할인 등이 있습니다. 최고의 ML 평가자가 순위표에 적용하는 것과 동일한 회의적인 위생이 이제 소프트웨어 에이전트 자체로 확장되었습니다.

에이전트가 소프트웨어를 구축하고 측정하는 작업을 더 많이 맡게 되면서 재미없는 감사를 기꺼이 수행하려는 사람들은 희소한 자원이 됩니다. Luu의 말에 따르면 벤치마크 종말은 다가오지 않습니다. 그것은 이미 여기에 있습니다.

AI보다 앞서 나가세요

AI 평가, 에이전트 연구, 기계 지능 측정 과학에 관한 최신 AI 뉴스를 받아보세요AI 뉴스 더 읽기 →