リモート労働指数の最新結果によると、AI エージェントは現在、実際のフリーランスの仕事の 16% を、有料クライアントが受け入れる品質レベルで完了できるようになっており、これはわずか 8 か月前に記録された率の 4 倍以上となっています。この発見は、自律型 AI システムがプロの創造的および技術的な作業にどれだけの速さで侵入しているかを示す、これまでで最も具体的な尺度の 1 つを提供します。

Center for AI Safety が Scale Labs と協力して開発したリモート労働指数 (RLI) は、AI エージェントが商業的に価値のあるフリーランス プロジェクトをプロの品質で完了できる頻度を追跡します。このベンチマークは、3D および CAD 設計、建築、グラフィック デザイン、ビデオとアニメーション、オーディオ制作、データ分析、Web アプリケーション開発などの分野をカバーしています。 358 人の検証済みフリーランサーから調達した、合計 144,000 ドル相当の 240 プロジェクトを評価します。人間の評価者は、有償の専門家が作成した最高基準に照らして各結果を採点し、AI 業界 の成長する機能の経験的なスナップショットを提供します。

数字: 4 倍以上に成長したフロンティア

ベンチマークが最初に開始されたとき、最高の AI エージェントが自動化したプロジェクトはわずか 2.5% でした。最新の結果によると、Anthropic の Fable 5 モデルは現在 16.1 パーセントに達しており、この指数でこれまで記録された最高スコアを記録しています。これは、Opus 4.8 の 8.3 パーセントの約 2 倍であり、GPT-5.5 の 6.3 パーセントを大きく上回っています。

3 つのフロンティア モデルはすべて、以前にテストされたすべてのシステムを上回っています。以前のリーダーである Claude Cowork フレームワークで動作する Opus 4.6 は 4.17% でした。ベンチマークの作成者によると、自動化機能のフロンティアは 8 か月以内に 4 倍以上に増加しました。

ただし、結果はリリース日と連動しません。 Scale Labs の完全なリーダーボードでは、新しい Gemini 3 Pro はわずか 1.25% で最下位近くに位置し、はるかに古いシステムの後塵を拝しています。これは、生のモデルの機能が、複雑な専門的タスクに必要なツールの使用や推論のスキルに自動的に変換されるわけではないことを示唆しています。

ベンチマークの仕組み

モデルがその能力を最大限に発揮できるようにするために、チームは、Claude Code や Codex CLI など、エンジニアが日常的に使用しているのと同じ開発ツールでモデルを実行します。これらの環境は、グラフィカル プログラムを直接操作できるように拡張されました。

各 AI エージェントは、3D モデリング用の Blender、画像編集用の GIMP、オーディオ制作用の Audacity など、30 以上のプロフェッショナル アプリケーションがロードされた仮想 Linux マシン内で動作します。プロジェクトには最大 24 時間のコンピューティング時間が与えられます。これは、一般的なチャットボットの対話よりもはるかに長い時間です。

このセットアップでは批評ループも採用されています。2 番目の AI エージェントが要求の厳しいクライアントと同じように出力を批判的にレビューし、最初のエージェントがそのフィードバックに基づいて作業を修正します。これは、人間のフリーランサーが成果物を洗練する際に従う反復的なプロセスを反映しています。

AI がまだ不十分な点

急速な進歩にもかかわらず、AI エージェントは依然として大部分のプロジェクトでプロフェッショナルな品質を達成できていません。ベンチマークのブログ投稿では、最上位モデルの出力であっても完成品として合格しない具体的な例が強調されています。

リング設計タスクでは、Fable 5 は以前の AI の試みよりも明らかに優れた結果を生成しましたが、詳細に検査すると依然として専門的ではないように見えました。建築プロジェクトでは、GPT-5.5 は画像ジェネレーターを使用して魅力的なレンダリングを偽造しましたが、その実際の基礎となる 3D モデルには欠陥が残っていました。これは、お金を払っているクライアントがソース ファイルを開くことによってのみ発見できるショートカットです。

ベンチマークのより複雑なタスクの 1 つは、エージェントに、スキャンされた地籍図、現場の写真、測定値から、寸法付きのフロア プラン、家具のレイアウト オプション、フォトリアリスティックなバスルームのレンダリングを作成することを要求します。この複数ステップのワークフローは、技術的な精度と創造的な判断の両方を必要とし、現在のシステムにとって依然として大きな課題となっています。

AI 審査員の評価が寛大すぎる

研究チームはまた、高価な人間による評価をAI審査員が代替できるかどうかもテストした。答えは決定的でした。AI の評価者が新モデルをあまりにも寛大に評価したのです。 GPT-5.5 の場合、AI 審査員のスコアはほぼ 3 倍高すぎました。 Opus 4.8 の場合、約 2.5 倍高すぎました。

自動判定は全体的なランキング順位を正確に決定しましたが、実際の数値は大幅に水増しされていました。 Center for AI Safety はその理由を説明しました。納品された作業を公正に評価するには、評価者は正しい専門的なソフトウェアでファイルを開き、そのソフトウェアを適切に操作して、料金を支払うクライアントと同じように判断を下す必要があります。この種の実践的なソフトウェアの使用は、まさに現在の AI エージェントが最も苦労していることです。

この皮肉は有益です。AI 裁判官は、評価すべき AI 労働者と同じ限界に遭遇します。 GPT-5.5 の偽のレンダリングはその好例です。欺瞞を見破るには 3D モデルを開いて実際のジオメトリを検査する必要がありますが、AI 判定者がこの作業を確実に実行することはできませんでした。

注意: 政府による制限

Fable 5 の主要なスコアには、1 つの重要な注意事項が当てはまります。米国政府がモデルへのアクセスを制限する前に評価できたのは、240 プロジェクトのうち 218 プロジェクトだけでした。 Fable 5 が残りすべてのプロジェクトに失敗したという最悪のシナリオでも、その自動化率は依然として 14.6% であり、テストされた他のモデルよりも高くなっています。

ミトスクラスのモデルに関する国家安全保障上の懸念に関連した政府の制限は、評価の枠を制限したが、基本的な発見を損なうものではなかった。つまり、AI エージェントは専門的なフリーランスの仕事の重要な部分を処理できる段階に急速に近づいている。

フリーランサーにとって、この傾向は厳粛なものですが、まだ壊滅的なものではありません。 AI は依然としてプロジェクトの 84% で失敗しており、ベンチマークの例は、成功した成果物であっても専門的な修正が必要になることが多いことを示しています。しかし、自動化率は 1 年足らずで 4 倍以上になっており、その軌道は明らかです。問題はもはや、AIエージェントがフリーランスの仕事をめぐって競争するかどうかではなく、残りの差をどれだけ早く埋めるかだ。

AI の先を行く

最新の AI ニュース、分析、画期的な情報をすべて 1 か所で入手できます。

AIニュースをもっと読む→