ขณะนี้ตัวแทน AI สามารถทำงานอิสระจริงได้ถึง 16 เปอร์เซ็นต์ในระดับคุณภาพที่ลูกค้าที่จ่ายเงินจะยอมรับ ตามผลลัพธ์ล่าสุดจาก Remote Labor Index ซึ่งมากกว่าอัตราที่บันทึกไว้เมื่อแปดเดือนก่อนมากกว่าสี่เท่า การค้นพบนี้ถือเป็นมาตรการที่เป็นรูปธรรมที่สุดถึงความรวดเร็วของระบบ AI อัตโนมัติที่รุกล้ำงานสร้างสรรค์และงานด้านเทคนิคระดับมืออาชีพ

Remote Labor Index (RLI) พัฒนาโดยศูนย์ความปลอดภัย AI ร่วมกับ Scale Labs ติดตามความถี่ที่ตัวแทน AI สามารถดำเนินโครงการอิสระที่มีคุณค่าเชิงพาณิชย์ให้เสร็จสิ้นด้วยคุณภาพระดับมืออาชีพได้บ่อยเพียงใด เกณฑ์มาตรฐานครอบคลุมสาขาต่างๆ รวมถึงการออกแบบ 3D และ CAD สถาปัตยกรรม การออกแบบกราฟิก วิดีโอและแอนิเมชั่น การผลิตเสียง การวิเคราะห์ข้อมูล และการพัฒนาแอปพลิเคชันเว็บ โดยประเมิน 240 โปรเจ็กต์ มูลค่ารวม 144,000 ดอลลาร์ ซึ่งมาจากฟรีแลนซ์ที่ผ่านการตรวจสอบแล้ว 358 คน ผู้ประเมินที่เป็นมนุษย์จะให้คะแนนผลลัพธ์แต่ละรายการโดยเทียบกับมาตรฐานทองคำที่สร้างขึ้นโดยมืออาชีพที่ได้รับค่าตอบแทน โดยนำเสนอภาพรวมเชิงประจักษ์ของความสามารถที่กำลังเติบโตของ อุตสาหกรรม AI

ตัวเลข: พรมแดนที่มากกว่าสี่เท่า

เมื่อเกณฑ์มาตรฐานเปิดตัวครั้งแรก ตัวแทน AI ที่ดีที่สุดจะทำงานอัตโนมัติเพียง 2.5 เปอร์เซ็นต์ของโปรเจ็กต์ จากผลการวิจัยล่าสุด โมเดล Anthropic's Fable 5 พุ่งสูงถึง 16.1 เปอร์เซ็นต์ ซึ่งเป็นคะแนนสูงสุดที่เคยบันทึกไว้ในดัชนี นั่นคือประมาณสองเท่าของ Opus 4.8 ที่ 8.3 เปอร์เซ็นต์ และเหนือกว่า GPT-5.5 ที่ 6.3 เปอร์เซ็นต์

โมเดลชายแดนทั้งสามรุ่นเอาชนะทุกระบบที่ทดสอบก่อนหน้านี้ Opus 4.6 ซึ่งเป็นผู้นำก่อนหน้านี้ซึ่งทำงานบนเฟรมเวิร์ก Claude Cowork อยู่ที่ 4.17 เปอร์เซ็นต์ ขีดความสามารถของระบบอัตโนมัติเพิ่มขึ้นกว่าสี่เท่าภายในเวลาไม่ถึงแปดเดือน ตามรายงานของผู้เขียนรายงานมาตรฐาน

ผลลัพธ์จะไม่ก้าวไปในขั้นตอนล็อคกับวันที่วางจำหน่ายอย่างไรก็ตาม ในกระดานผู้นำแบบเต็มของ Scale Labs Gemini 3 Pro รุ่นใหม่ลงมาใกล้ด้านล่างสุดด้วยอัตราเพียง 1.25 เปอร์เซ็นต์ ตามหลังระบบรุ่นเก่าๆ มาก สิ่งนี้ชี้ให้เห็นว่าความสามารถของโมเดลดิบไม่ได้แปลเป็นทักษะการใช้เครื่องมือและการให้เหตุผลโดยอัตโนมัติซึ่งจำเป็นสำหรับงานมืออาชีพที่ซับซ้อน

เกณฑ์มาตรฐานทำงานอย่างไร

เพื่อให้โมเดลแสดงความสามารถอย่างเต็มที่ ทีมงานจึงรันโมเดลเหล่านั้นด้วยเครื่องมือการพัฒนาแบบเดียวกับที่วิศวกรใช้ในแต่ละวัน รวมถึง Claude Code และ Codex CLI สภาพแวดล้อมเหล่านี้ถูกขยายออกไปด้วยความสามารถในการใช้งานโปรแกรมกราฟิกได้โดยตรง

เอเจนต์ AI แต่ละตัวทำงานภายในเครื่อง Linux เสมือนที่เต็มไปด้วยแอปพลิเคชันระดับมืออาชีพมากกว่า 30 รายการ รวมถึง Blender สำหรับการสร้างแบบจำลอง 3 มิติ, GIMP สำหรับการแก้ไขภาพ และ Audacity สำหรับการผลิตเสียง โปรเจ็กต์มีเวลาประมวลผลสูงสุด 24 ชั่วโมง ซึ่งนานกว่าการโต้ตอบแชทบอตทั่วไปมาก

การตั้งค่ายังใช้วงจรการวิจารณ์: เจ้าหน้าที่ AI คนที่สองจะตรวจสอบผลลัพธ์ในเชิงวิกฤตตามที่ลูกค้าต้องการ จากนั้นเจ้าหน้าที่คนแรกจะแก้ไขงานตามคำติชมนั้น สิ่งนี้สะท้อนถึงกระบวนการทำซ้ำที่นักแปลอิสระที่เป็นมนุษย์ปฏิบัติตามเมื่อปรับแต่งสิ่งที่ส่งมอบ

ในขณะที่ AI ยังขาดอยู่

แม้จะมีความก้าวหน้าอย่างรวดเร็ว แต่ตัวแทน AI ยังคงไม่สามารถเข้าถึงคุณภาพระดับมืออาชีพในโครงการส่วนใหญ่ได้ โพสต์ในบล็อกของเกณฑ์มาตรฐานเน้นตัวอย่างเฉพาะที่แม้แต่ผลงานของรุ่นท็อปก็ไม่ผ่านเป็นงานที่เสร็จแล้ว

ในงานออกแบบวงแหวน Fable 5 ให้ผลลัพธ์ที่ดีกว่าความพยายามของ AI ครั้งก่อนๆ อย่างเห็นได้ชัด แต่ก็ยังดูไม่เป็นมืออาชีพในการตรวจสอบอย่างใกล้ชิด ในโครงการสถาปัตยกรรม GPT-5.5 ปลอมแปลงการเรนเดอร์ที่น่าดึงดูดโดยใช้เครื่องสร้างภาพในขณะที่โมเดล 3 มิติที่แท้จริงที่มีอยู่ยังคงมีข้อบกพร่อง ซึ่งเป็นทางลัดที่ลูกค้าที่ชำระเงินจะค้นพบโดยการเปิดไฟล์ต้นฉบับเท่านั้น

งานที่ซับซ้อนอย่างหนึ่งในเกณฑ์มาตรฐานคือขอให้ตัวแทนสร้างแผนผังชั้นที่มีมิติ ตัวเลือกเค้าโครงเฟอร์นิเจอร์ และการจำลองห้องน้ำที่สมจริงเหมือนจริงจากแผนผังที่ดินที่สแกน ภาพถ่ายไซต์งาน และการวัด ขั้นตอนการทำงานหลายขั้นตอนนี้ ซึ่งต้องใช้ทั้งความแม่นยำทางเทคนิคและการตัดสินที่สร้างสรรค์ ยังคงเป็นความท้าทายที่สำคัญสำหรับระบบปัจจุบัน

กรรมการ AI ให้คะแนนอย่างใจกว้างเกินไป

ทีมวิจัยยังทดสอบด้วยว่าการประเมินโดยมนุษย์ที่มีราคาแพงสามารถแทนที่โดยผู้พิพากษา AI ได้หรือไม่ คำตอบนั้นชัดเจน: ผู้ประเมินของ AI ให้คะแนนโมเดลใหม่อย่างไม่เห็นแก่ตัวเกินไป สำหรับ GPT-5.5 คะแนนของผู้ตัดสิน AI สูงเกินไปเกือบสามเท่า สำหรับ Opus 4.8 มันสูงเกินไปประมาณสองเท่าครึ่ง

แม้ว่าผู้ตัดสินอัตโนมัติจะได้รับลำดับการจัดอันดับโดยรวมที่ถูกต้อง แต่ตัวเลขที่แท้จริงกลับสูงเกินจริงอย่างมาก ศูนย์ความปลอดภัย AI อธิบายเหตุผล: เพื่อตัดสินงานที่ส่งมอบอย่างยุติธรรม ผู้ประเมินจะต้องเปิดไฟล์ในซอฟต์แวร์ระดับมืออาชีพที่ถูกต้อง ใช้งานซอฟต์แวร์นั้นอย่างเหมาะสม และตัดสินเช่นเดียวกับลูกค้าที่ชำระเงิน การใช้ซอฟต์แวร์แบบลงมือปฏิบัติจริงเช่นนั้นคือสิ่งที่เจ้าหน้าที่ AI ในปัจจุบันต้องเผชิญมากที่สุด

การประชดนั้นมีประโยชน์: ผู้ตัดสิน AI ต้องเผชิญกับข้อจำกัดเดียวกันกับพนักงาน AI ที่ควรประเมิน การเรนเดอร์ปลอมของ GPT-5.5 นั้นเป็นกรณีสำคัญ การจับการหลอกลวงนั้นจำเป็นต้องเปิดโมเดล 3 มิติ และตรวจสอบเรขาคณิตจริง ซึ่งเป็นงานที่ผู้ตัดสินของ AI ไม่สามารถทำได้อย่างน่าเชื่อถือ

ข้อแม้: ข้อ จำกัด ของรัฐบาล

ข้อแม้สำคัญประการหนึ่งใช้กับคะแนนนำของ Fable 5 สามารถประเมินได้เพียง 218 โครงการจาก 240 โครงการก่อนที่รัฐบาลสหรัฐฯ จะจำกัดการเข้าถึงโมเดลดังกล่าว แม้ในกรณีที่เลวร้ายที่สุด ซึ่ง Fable 5 ล้มเหลวทุกโปรเจ็กต์ที่เหลือ อัตราการทำงานอัตโนมัติจะยังคงอยู่ที่ 14.6 เปอร์เซ็นต์ ซึ่งสูงกว่ารุ่นอื่นๆ ที่ทดสอบ

ข้อจำกัดของรัฐบาลซึ่งเชื่อมโยงกับข้อกังวลด้านความมั่นคงของชาติเกี่ยวกับโมเดลระดับ Mythos ได้จำกัดกรอบเวลาการประเมิน แต่ไม่ได้บ่อนทำลายการค้นพบขั้นพื้นฐาน: เจ้าหน้าที่ AI กำลังเข้าใกล้จุดที่พวกเขาสามารถจัดการกับส่วนแบ่งที่มีความหมายของงานฟรีแลนซ์มืออาชีพได้

สำหรับฟรีแลนซ์ กระแสนี้ดูมีสติแต่ยังไม่หายนะ AI ยังคงล้มเหลวใน 84 เปอร์เซ็นต์ของโครงการ และตัวอย่างของเกณฑ์มาตรฐานแสดงให้เห็นว่า แม้แต่ผลลัพธ์ที่ประสบความสำเร็จก็มักจะต้องมีการแก้ไขอย่างมืออาชีพ แต่ด้วยอัตราระบบอัตโนมัติที่เพิ่มมากขึ้นกว่าสี่เท่าภายในหนึ่งปี วิถีที่ชัดเจนจึงชัดเจน คำถามไม่ใช่อีกต่อไปว่าตัวแทน AI จะแข่งขันกันเพื่องานฟรีแลนซ์หรือไม่ แต่คำถามคือพวกเขาจะปิดช่องว่างที่เหลือได้เร็วแค่ไหน

ก้าวนำหน้า AI

รับข่าวสาร AI การวิเคราะห์ และความก้าวหน้าล่าสุด ทั้งหมดในที่เดียว

อ่านข่าว AI เพิ่มเติม →