원격 노동 지수(Remote Labor Index)의 최신 결과에 따르면 AI 에이전트는 이제 유료 클라이언트가 수용할 수 있는 품질 수준으로 실제 프리랜스 작업의 16%를 완료할 수 있습니다. 이는 불과 8개월 전에 기록된 비율보다 4배 이상 높은 수치입니다. 이번 발견은 자율 AI 시스템이 전문적인 창의적 작업과 기술 작업을 얼마나 빨리 잠식하고 있는지에 대한 가장 구체적인 척도 중 하나를 제공합니다.
Scale Labs와 협력하여 AI 안전 센터에서 개발한 RLI(원격 노동 지수)는 AI 에이전트가 상업적으로 가치 있는 프리랜서 프로젝트를 전문가 수준으로 얼마나 자주 완료할 수 있는지 추적합니다. 벤치마크는 3D 및 CAD 디자인, 건축, 그래픽 디자인, 비디오 및 애니메이션, 오디오 제작, 데이터 분석, 웹 애플리케이션 개발 등의 분야를 다룹니다. 358명의 검증된 프리랜서로부터 조달된 총 $144,000 상당의 240개 프로젝트를 평가합니다. 인간 평가자는 유급 전문가가 만든 표준에 따라 각 결과를 평가하여 AI 산업의 성장 역량에 대한 실증적 스냅샷을 제공합니다.
숫자: 4배 이상 증가한 개척지
벤치마크가 처음 출시되었을 때 최고의 AI 에이전트는 프로젝트의 2.5%만을 자동화했습니다. 최신 결과에 따르면, Anthropic의 Fable 5 모델은 이제 16.1%를 기록했습니다. 이는 지수 사상 최고 점수입니다. 이는 Opus 4.8의 8.3%의 대략 두 배이고 GPT-5.5의 6.3%보다 훨씬 앞서 있습니다.
세 가지 프론티어 모델 모두 이전에 테스트한 모든 시스템을 능가했습니다. Claude Cowork 프레임워크에서 실행되는 이전 리더인 Opus 4.6은 4.17%를 기록했습니다. 벤치마크 작성자에 따르면 자동화 기능의 한계는 8개월 이내에 4배 이상 증가했습니다.
그러나 결과는 출시일에 맞춰 움직이지 않습니다. 전체 Scale Labs 순위표에서 최신 Gemini 3 Pro는 단 1.25%로 최하위에 도달하여 훨씬 오래된 시스템에 뒤처졌습니다. 이는 원시 모델 기능이 복잡한 전문 작업에 필요한 일종의 도구 사용 및 추론 기술로 자동 변환되지 않음을 의미합니다.
벤치마크 작동 방식
모델이 모든 기능을 발휘할 수 있도록 팀은 Claude Code 및 Codex CLI를 포함하여 엔지니어가 매일 사용하는 것과 동일한 개발 도구에서 모델을 실행합니다. 이러한 환경은 그래픽 프로그램을 직접 작동할 수 있는 기능으로 확장되었습니다.
각 AI 에이전트는 3D 모델링용 Blender, 이미지 편집용 GIMP, 오디오 제작용 Audacity를 포함하여 30개 이상의 전문 애플리케이션이 로드된 가상 Linux 시스템 내에서 작동합니다. 프로젝트에는 일반적인 챗봇 상호 작용보다 훨씬 긴 최대 24시간의 컴퓨팅 시간이 제공됩니다.
이 설정은 또한 비판 루프를 사용합니다. 두 번째 AI 에이전트는 까다로운 클라이언트처럼 비판적으로 출력을 검토하고 첫 번째 에이전트는 해당 피드백을 기반으로 작업을 수정합니다. 이는 인간 프리랜서가 결과물을 다듬을 때 따르는 반복적인 프로세스를 반영합니다.
AI가 여전히 부족한 부분
빠른 발전에도 불구하고 AI 에이전트는 여전히 대부분의 프로젝트에서 전문적인 품질을 달성하지 못하고 있습니다. 벤치마크의 블로그 게시물은 최상위 모델의 출력조차도 완성된 작업으로 통과되지 않는 구체적인 예를 강조합니다.
링 디자인 작업에서 Fable 5는 이전 AI 시도보다 확실히 더 나은 결과를 생성했지만 면밀한 조사에서는 여전히 비전문적으로 보였습니다. 건축 프로젝트에서 GPT-5.5는 실제 기본 3D 모델에 결함이 남아 있는 동안 이미지 생성기를 사용하여 매력적인 렌더링을 위조했습니다. 이는 유료 클라이언트가 소스 파일을 열어야만 발견할 수 있는 지름길입니다.
벤치마크에서 더 복잡한 작업 중 하나는 에이전트에게 스캔한 지적 계획, 현장 사진 및 측정값을 바탕으로 치수가 지정된 평면도, 가구 레이아웃 옵션 및 사실적인 욕실 렌더링을 생성하도록 요청합니다. 기술적 정확성과 창의적인 판단이 모두 필요한 이러한 다단계 작업 흐름은 현재 시스템에 있어 여전히 중요한 과제로 남아 있습니다.
AI 심사위원이 너무 관대하게 평가함
연구팀은 비용이 많이 드는 인간 평가를 AI 심사위원으로 대체할 수 있는지 여부도 테스트했다. 대답은 확실했습니다. AI 평가자들은 새 모델을 너무 관대하게 평가했습니다. GPT-5.5의 경우 AI 심사위원의 점수가 거의 3배나 높았습니다. Opus 4.8의 경우 대략 2.5배나 높았습니다.
자동 심사위원이 전반적인 순위 순서를 올바르게 결정했지만 실제 숫자는 상당히 부풀려졌습니다. AI 안전센터는 제공된 작업을 공정하게 판단하기 위해 평가자가 올바른 전문 소프트웨어에서 파일을 열고 해당 소프트웨어를 올바르게 작동하며 유료 클라이언트와 마찬가지로 판단을 내려야 한다고 추론을 설명했습니다. 이러한 종류의 실습 소프트웨어 사용은 바로 현재 AI 에이전트가 가장 어려움을 겪는 부분입니다.
아이러니는 교훈적이다. AI 판사는 평가해야 하는 AI 작업자와 동일한 한계에 직면한다. GPT-5.5의 가짜 렌더링이 적절한 예입니다. 속임수를 포착하려면 3D 모델을 열고 실제 형상을 검사해야 하는데, AI 심사위원이 안정적으로 수행할 수 없는 작업입니다.
주의사항: 정부 제한사항
Fable 5의 주요 점수에는 한 가지 중요한 경고가 적용됩니다. 미국 정부가 모델에 대한 접근을 제한하기 전에는 240개 프로젝트 중 218개만 평가할 수 있었습니다. Fable 5가 나머지 모든 프로젝트에 실패하는 최악의 시나리오에서도 자동화 비율은 여전히 14.6%로 테스트된 다른 어떤 모델보다 높습니다.
Mythos 클래스 모델에 대한 국가 안보 문제와 관련된 정부 제한으로 인해 평가 기간이 제한되었지만 근본적인 결론은 훼손되지 않았습니다. AI 에이전트는 전문 프리랜서 작업의 의미 있는 부분을 처리할 수 있는 지점에 빠르게 접근하고 있습니다.
프리랜서들에게 이러한 추세는 냉정하지만 아직은 재앙이 아닐 정도입니다. AI는 여전히 프로젝트의 84%에서 실패하며, 벤치마크의 예는 성공적인 결과라도 전문적인 수정이 필요한 경우가 많다는 것을 보여줍니다. 그러나 자동화 비율이 1년 이내에 4배 이상 증가함에 따라 궤적은 분명해졌습니다. 문제는 더 이상 AI 에이전트가 프리랜서 작업을 위해 경쟁할지 여부가 아니라 남은 격차를 얼마나 빨리 메울 수 있는지입니다.
AI보다 앞서 나가세요
최신 AI 뉴스, 분석, 획기적인 소식을 모두 한 곳에서 받아보세요.
AI 뉴스 자세히 보기 →


