AI-agenter kan nu slutföra 16 procent av riktiga frilansjobb på en kvalitetsnivå som betalande kunder skulle acceptera, enligt de senaste resultaten från Remote Labor Index – mer än fyrdubbla den takt som registrerades för bara åtta månader sedan. Fyndet ger en av de mest konkreta måtten hittills på hur snabbt autonoma AI-system inkräktar på professionellt kreativt och tekniskt arbete.
Remote Labor Index (RLI), utvecklat av Center for AI Safety i samarbete med Scale Labs, spårar hur ofta AI-agenter kan avsluta kommersiellt värdefulla frilansprojekt med professionell kvalitet. Benchmarket täcker områden inklusive 3D- och CAD-design, arkitektur, grafisk design, video och animation, ljudproduktion, dataanalys och webbapplikationsutveckling. Den utvärderar 240 projekt värda sammanlagt $144 000, hämtade från 358 verifierade frilansare. Mänskliga utvärderare poängsätter varje resultat mot en guldstandard skapad av en betald professionell, och erbjuder en empirisk ögonblicksbild av AI-industrins växande kapacitet.
The Numbers: A Frontier That More Than Quadrupled
När riktmärket först lanserades automatiserade den bästa AI-agenten bara 2,5 procent av projekten. Enligt de senaste resultaten når Anthropics Fable 5-modell nu 16,1 procent – den högsta poängen som någonsin registrerats på indexet. Det är ungefär det dubbla av Opus 4,8:s 8,3 procent och långt över GPT-5,5:s 6,3 procent.
Alla tre frontier-modellerna slår alla tidigare testade system. Den tidigare ledaren, Opus 4.6 som körde på Claude Cowork-ramverket, satt på 4,17 procent. Gränsen för automationskapacitet har mer än fyrdubblats på under åtta månader, enligt riktmärkets författare.
Resultaten går dock inte i lås med releasedatum. På hela Scale Labs-poängtavlan landar den nyare Gemini 3 Pro nära botten på bara 1,25 procent, efter mycket äldre system. Detta tyder på att råmodellförmåga inte automatiskt översätts till den typ av verktygsanvändning och resonemangsförmåga som behövs för komplexa professionella uppgifter.
Hur riktmärket fungerar
För att låta modellerna visa sin fulla förmåga, kör teamet dem i samma utvecklingsverktyg som ingenjörer använder dagligen, inklusive Claude Code och Codex CLI. Dessa miljöer utökades med möjligheten att använda grafiska program direkt.
Varje AI-agent arbetar i en virtuell Linux-maskin laddad med över 30 professionella applikationer, inklusive Blender för 3D-modellering, GIMP för bildredigering och Audacity för ljudproduktion. Projekt ges upp till 24 timmars beräkningstid – mycket längre än en typisk chatbot-interaktion.
Installationen använder också en kritikerslinga: en andra AI-agent granskar resultatet lika kritiskt som en krävande klient skulle göra, och den första agenten reviderar sedan sitt arbete baserat på den feedbacken. Detta speglar den iterativa process som mänskliga frilansare följer när de förfinar leveranser.
Där AI fortfarande faller kort
Trots de snabba framstegen misslyckas AI-agenter fortfarande med att nå professionell kvalitet på de allra flesta projekt. Benchmarkens blogginlägg lyfter fram specifika exempel där även toppmodellens produktion inte skulle passera som färdigt arbete.
På en ringdesignuppgift gav Fable 5 ett resultat som var klart bättre än tidigare AI-försök men som fortfarande såg oprofessionellt ut vid noggrann inspektion. I ett arkitekturprojekt fejkade GPT-5.5 en tilltalande rendering med hjälp av en bildgenerator medan dess faktiska underliggande 3D-modell förblev felaktig - en genväg som en betalande klient bara skulle upptäcka genom att öppna källfilerna.
En av de mer komplexa uppgifterna i riktmärket ber agenten att skapa en dimensionerad planlösning, alternativ för möbellayout och fotorealistiska badrumsrenderingar från en skannad fastighetsplan, platsfoton och mått. Detta arbetsflöde i flera steg, som kräver både teknisk precision och kreativ bedömning, är fortfarande en betydande utmaning för nuvarande system.
AI-domare betygsätter för generöst
Forskargruppen testade också om dyra mänskliga utvärderingar kunde ersättas av AI-domare. Svaret var definitivt: AI-utvärderare betygsatte de nya modellerna alldeles för generöst. För GPT-5.5 var AI-domarens poäng nästan tre gånger för hög. För Opus 4.8 var den ungefär två och en halv gånger för hög.
Medan den automatiserade domaren fick den övergripande rankningsordningen rätt, var de faktiska siffrorna kraftigt uppblåsta. Center for AI Safety förklarade resonemanget: för att rättvist bedöma levererat arbete måste en utvärderare öppna filerna i rätt professionell programvara, använda den programvaran på rätt sätt och göra en bedömning som en betalande kund skulle göra. Den typen av praktisk mjukvaruanvändning är precis vad nuvarande AI-agenter kämpar mest med.
Ironin är lärorik: en AI-domare stöter på samma begränsningar som AI-arbetarna den ska utvärdera. GPT-5.5:s fejkade rendering är ett exempel - att fånga bedrägeriet kräver att man öppnar 3D-modellen och inspekterar den faktiska geometrin, en uppgift som AI-domaren inte kunde utföra på ett tillförlitligt sätt.
Varningen: Regeringens begränsningar
En viktig varning gäller Fable 5:s ledande poäng. Endast 218 av de 240 projekten kunde utvärderas innan USA:s regering begränsade tillgången till modellen. Även i det värsta scenariot, där Fable 5 misslyckades med alla återstående projekt, skulle dess automatiseringsgrad fortfarande vara 14,6 procent - högre än någon annan testad modell.
De statliga restriktionerna, kopplade till nationella säkerhetsproblem om Mythos-klassmodellerna, begränsade utvärderingsfönstret men undergrävde inte det grundläggande resultatet: AI-agenter närmar sig snabbt den punkt där de kan hantera en meningsfull del av professionellt frilansarbete.
För frilansare är trenden nykter men ännu inte katastrofal. AI misslyckas fortfarande i 84 procent av projekten, och riktmärkets exempel visar att även framgångsrika resultat ofta kräver professionell revision. Men med automatiseringstakten mer än fyrdubblad på under ett år är banan tydlig. Frågan är inte längre om AI-agenter kommer att konkurrera om frilansarbete, utan hur snabbt de kommer att täppa till det återstående gapet.
Ligg före AI
Få de senaste AI-nyheterna, analyserna och genombrotten – allt på ett ställe.
Läs mer AI-nyheter →


