Agenti umělé inteligence mohou nyní dokončit 16 procent skutečných zakázek na volné noze na úrovni kvality, kterou by platící klienti přijali, podle nejnovějších výsledků indexu vzdálené práce – více než čtyřnásobek míry zaznamenané před pouhými osmi měsíci. Toto zjištění poskytuje jedno z dosud nejkonkrétnějších měřítek toho, jak rychle autonomní systémy umělé inteligence zasahují do profesionální kreativní a technické práce.
Index vzdálené práce (RLI), vyvinutý Centrem pro bezpečnost umělé inteligence ve spolupráci se Scale Labs, sleduje, jak často mohou agenti umělé inteligence dokončit komerčně hodnotné projekty na volné noze v profesionální kvalitě. Tento benchmark pokrývá oblasti zahrnující 3D a CAD design, architekturu, grafický design, video a animaci, audio produkci, analýzu dat a vývoj webových aplikací. Hodnotí 240 projektů v celkové hodnotě 144 000 USD, které pocházejí od 358 ověřených nezávislých pracovníků. Lidští hodnotitelé hodnotí každý výsledek oproti zlatému standardu vytvořenému placeným profesionálem a nabízejí empirický přehled rostoucích schopností odvětví AI.
Čísla: Hranice, která se více než zčtyřnásobila
Když byl benchmark poprvé spuštěn, nejlepší agent AI automatizoval pouze 2,5 procenta projektů. Podle nejnovějších výsledků nyní model Fable 5 společnosti Anthropic dosahuje 16,1 procenta, což je nejvyšší skóre, jaké kdy index zaznamenal. To je zhruba dvojnásobek Opus 4.8 8,3 procenta a daleko před GPT-5.5 6,3 procenta.
Všechny tři hraniční modely porazily všechny dříve testované systémy. Předchozí lídr, Opus 4.6 běžící na frameworku Claude Cowork, měl 4,17 procenta. Podle autorů benchmarku se hranice možností automatizace za necelých osm měsíců více než zčtyřnásobila.
Výsledky se však nepohybují v souladu s datem vydání. Na úplném žebříčku Scale Labs se novější Gemini 3 Pro drží těsně u dna s pouhými 1,25 procenty a zaostává za mnohem staršími systémy. To naznačuje, že schopnost surového modelu se automaticky nepromítá do druhu používání nástrojů a dovedností uvažování potřebných pro složité profesionální úkoly.
Jak Benchmark funguje
Aby mohly modely předvést své plné schopnosti, tým je provozuje ve stejných vývojových nástrojích, které inženýři používají každý den, včetně Claude Code a Codex CLI. Tato prostředí byla rozšířena o možnost přímého ovládání grafických programů.
Každý agent AI pracuje v rámci virtuálního linuxového stroje s více než 30 profesionálními aplikacemi, včetně Blenderu pro 3D modelování, GIMPu pro úpravu obrázků a Audacity pro produkci zvuku. Projektům je poskytnuto až 24 hodin výpočetního času – mnohem déle než typická interakce s chatbotem.
Nastavení také využívá kritickou smyčku: druhý agent AI zkontroluje výstup stejně kriticky, jako by to udělal náročný klient, a první agent pak na základě této zpětné vazby reviduje svou práci. To odráží iterativní proces, který lidé na volné noze sledují při zdokonalování výstupů.
Kde AI stále zaostává
Navzdory rychlému pokroku se AI agentům stále nedaří trefit profesionální kvalitu u naprosté většiny projektů. Blogový příspěvek benchmarku upozorňuje na konkrétní příklady, kdy by ani výstup topmodelky neprošel jako hotová práce.
Při úkolu návrhu prstenu Fable 5 přinesl výsledek, který byl jasně lepší než dřívější pokusy s umělou inteligencí, ale při bližším zkoumání stále vypadal neprofesionálně. Na architektonickém projektu GPT-5.5 zfalšoval přitažlivý render pomocí generátoru obrázků, zatímco jeho skutečný základní 3D model zůstal chybný – zkratku, kterou by platící klient objevil pouze otevřením zdrojových souborů.
Jeden ze složitějších úkolů v benchmarku vyžaduje, aby agent vytvořil okótovaný půdorys, možnosti rozmístění nábytku a fotorealistické vykreslení koupelny z naskenovaného katastrálního plánu, fotografií místa a měření. Tento vícestupňový pracovní postup, vyžadující jak technickou přesnost, tak kreativní úsudek, zůstává pro současné systémy významnou výzvou.
AI soudci hodnotí příliš velkoryse
Výzkumný tým také testoval, zda by drahé lidské hodnocení bylo možné nahradit soudci AI. Odpověď byla definitivní: hodnotitelé AI hodnotili nové modely až příliš velkoryse. U GPT-5.5 bylo skóre AI rozhodčího téměř třikrát příliš vysoké. U Opusu 4.8 to bylo zhruba dvaapůlkrát vyšší.
I když automatizovaný rozhodčí správně určil celkové pořadí, skutečná čísla byla výrazně nadsazená. Centrum pro bezpečnost umělé inteligence vysvětlilo zdůvodnění: aby hodnotitel spravedlivě posoudil dodanou práci, musí otevřít soubory ve správném profesionálním softwaru, správně tento software provozovat a vytvořit úsudek jako platící klient. Tento druh praktického používání softwaru je přesně to, s čím se současní agenti AI potýkají nejvíce.
Ironie je poučná: soudce AI naráží na stejná omezení jako pracovníci AI, které má hodnotit. Falešné vykreslování GPT-5.5 je toho příkladem – zachycení podvodu vyžaduje otevření 3D modelu a kontrolu skutečné geometrie, což je úkol, který AI rozhodčí nemohl spolehlivě provést.
Upozornění: Vládní omezení
Pro vedoucí skóre Fable 5 platí jedno důležité upozornění. Než vláda Spojených států omezila přístup k modelu, mohlo být vyhodnoceno pouze 218 z 240 projektů. I v nejhorším scénáři, kdy Fable 5 selže u každého zbývajícího projektu, by míra automatizace byla stále 14,6 procenta – vyšší než u kteréhokoli jiného testovaného modelu.
Vládní omezení spojená s obavami o národní bezpečnost ohledně modelů třídy Mythos omezila hodnotící okno, ale nepodkopala základní zjištění: agenti umělé inteligence se rychle blíží k bodu, kdy mohou zvládnout smysluplný podíl profesionální práce na volné noze.
Pro freelancery je trend střízlivý, ale zatím ne katastrofální. Umělá inteligence stále selhává na 84 procentech projektů a příklady benchmarku ukazují, že i úspěšné výstupy často vyžadují odbornou revizi. Ale s mírou automatizace, která se za méně než rok zčtyřnásobila, je trajektorie jasná. Otázkou již není, zda se agenti AI budou ucházet o práci na volné noze, ale jak rychle zacelí zbývající mezeru.
Udržujte si náskok před AI
Získejte nejnovější zprávy, analýzy a průlomové informace o umělé inteligenci – vše na jednom místě.
Přečtěte si další zprávy o AI →


