Patronus AI ซึ่งเป็นสตาร์ทอัพที่สร้างสภาพแวดล้อมดิจิทัลจำลองเพื่อประเมินเอเจนต์ AI อัตโนมัติ ได้ระดมเงินได้ 50 ล้านดอลลาร์ในรอบ Series B เนื่องจากความต้องการการทดสอบเอเจนต์ที่เชื่อถือได้เพิ่มสูงขึ้น รอบนี้นำโดย Greenfield Partners โดยมีส่วนร่วมจาก Notable Capital, Lightspeed, Datadog และ Samsung TechCrunch รายงาน ทำให้เงินทุนทั้งหมดของบริษัทอยู่ที่ 70 ล้านดอลลาร์
ปัญหาใหม่: เจ้าหน้าที่ที่ใช้ทางลัด For more context on this story, see our ongoing artificial intelligence updates.
เนื่องจากตัวแทน AI พัฒนาจากการตอบคำถามไปสู่การดำเนินงานที่ซับซ้อนและมีหลายขั้นตอนโดยอัตโนมัติ ผู้ให้บริการโมเดลและสตาร์ทอัพที่สร้างตัวแทนดังกล่าวจำเป็นต้องได้รับการรับรองว่าระบบจะทำงานได้อย่างน่าเชื่อถือในสถานการณ์ที่หลากหลาย ห้องปฏิบัติการ AI มักใช้เกณฑ์มาตรฐานเพื่อแสดงความกล้าหาญของแบบจำลอง แต่คะแนนที่สูงในเกณฑ์มาตรฐานเชิงเอเจนต์ไม่ได้พิสูจน์ว่า AI สามารถทำงานได้ในโลกแห่งความเป็นจริงอย่างถูกต้อง
ช่องว่างนั้นคือจุดที่ Patronus AI ให้ความสำคัญ ก่อตั้งขึ้นในปี 2566 โดยอดีตนักวิจัย Meta AI Anand Kannappan และ Rebecca Qian บริษัทในซานฟรานซิสโกสร้างสิ่งที่เรียกว่า "แบบจำลองโลกดิจิทัล" ซึ่งเป็นแบบจำลองของเว็บไซต์และระบบภายในที่ตัวแทนได้รับการทดสอบความเครียดหลังการฝึกอบรม เจ้าหน้าที่จะได้รับการประเมินโดยใช้การเรียนรู้แบบเสริมกำลัง ซึ่งจะให้รางวัลซ้ำๆ เมื่อทำงานสำเร็จและลงโทษข้อผิดพลาด
การยืมจากยานพาหนะอัตโนมัติ
บริษัทเปรียบเทียบแนวทางกับวิธีที่ Waymo ฝึกรถยนต์ไร้คนขับ โดยเริ่มแรกสร้างโลกสังเคราะห์เพื่อทดสอบยานพาหนะกับอันตรายที่หายาก เช่น สภาพอากาศเลวร้าย หรือเด็กวิ่งตามลูกบอล ข้อแตกต่างที่สำคัญของเจ้าหน้าที่ AI คือพวกเขามักจะใช้ทางลัด ซึ่งหมายความว่าพวกเขาล้มเหลวในการทำงานให้เสร็จสิ้นอย่างถูกต้อง แม้ว่าพวกเขาจะดูเหมือนสำเร็จก็ตาม
Glenn Solomon กรรมการผู้จัดการของ Notable Capital กล่าวว่า "Patronus เก่งมากในการตรวจพบการแฮ็ก และทำให้แน่ใจว่าพวกเขาจะรับผิดชอบต่อโมเดลต่างๆ" โซโลมอนอธิบายว่าความต้องการสภาพแวดล้อมจำลองของบริษัทนั้นแทบจะไม่เพียงพอ ปัจจุบันห้องปฏิบัติการ AI ระดับแนวหน้าและสตาร์ทอัพเกิดใหม่จำนวนมากกลายเป็นลูกค้าแล้ว และรายรับของ Patronus ก็เพิ่มขึ้น 15 เท่าในปีที่ผ่านมา
ขยายไปไกลกว่างานที่ตรวจสอบได้
ปัจจุบัน Patronus นำเสนอโลกดิจิทัลจำลองสำหรับวิศวกรรมซอฟต์แวร์และการเงิน ซึ่งเป็นสองโดเมนที่ตรวจสอบผลลัพธ์ได้ค่อนข้างง่าย แต่บริษัทมองว่าสิ่งเหล่านี้เป็นเพียงจุดเริ่มต้นเท่านั้น “วันนี้เราให้ความสำคัญอย่างมากกับปัญหาที่ตรวจสอบได้ ปัญหาที่คุณสามารถตรวจสอบและตรวจสอบได้ทันที แต่ยังมีอีกหลายประเด็นที่ไม่สามารถตรวจสอบได้หรือตรวจสอบได้ยากมาก” กรรณพันธ์กล่าว
ความทะเยอทะยานคือการสร้างสภาพแวดล้อมที่สำคัญพอที่จะทดสอบตัวแทนในขอบเขตอันยาวไกล “เราต้องการสร้างสภาพแวดล้อมที่คุณสามารถดำเนินการตัวแทนที่สามารถทำงานได้เป็นเวลา 10 ชั่วโมง 10 วัน หรือ 10 สัปดาห์” กรรณพันธ์กล่าว เพียงเพราะกระบวนการต่างๆ ตรวจสอบได้ไม่ได้หมายความว่ากระบวนการเหล่านั้นจะง่ายดาย และความสามารถในการตรวจจับตัวแทนที่ล้มเหลวในระหว่างขั้นตอนการทำงานที่กินเวลาหลายวันก็ถือเป็นหัวใจสำคัญของการนำเสนอคุณค่าของบริษัท
เงินทุนยังมาถึงในขณะที่อุตสาหกรรม AI ในวงกว้างต้องดิ้นรนกับวิธีการวัดความก้าวหน้า คะแนนเกณฑ์มาตรฐานกลายเป็นสกุลเงินที่มีการโต้แย้ง โดยนักวิจารณ์แย้งว่าแบบจำลองสามารถปรับให้เหมาะกับการทดสอบเฉพาะเกมโดยไม่ต้องปรับปรุงในงานจริงอย่างแท้จริง สภาพแวดล้อมจำลองของ Patronus เสนอทางเลือกตัวแทนการทดสอบในสถานการณ์ปลายเปิดซึ่งหลักฐานแห่งความสำเร็จเพียงอย่างเดียวคืองานที่เสร็จสมบูรณ์อย่างถูกต้องแทนที่จะเป็นตัวเลขบนกระดานผู้นำ
สำหรับลูกค้าองค์กร ความแตกต่างนั้นมีความสำคัญ เอเจนต์การเขียนโค้ดที่ผ่านเกณฑ์มาตรฐานแต่นำข้อบกพร่องมาสู่ฐานโค้ดที่ใช้งานจริงอย่างเงียบๆ หรือตัวแทนทางการเงินที่ปัดเศษตัวเลขไม่ถูกต้อง อาจสร้างความเสียหายได้มากกว่าที่คะแนนการทดสอบต่ำจะแนะนำได้มาก การตรวจจับความล้มเหลวเหล่านั้นในแซนด์บ็อกซ์ก่อนการใช้งาน Patronus กำลังวางตำแหน่งการประเมินเป็นข้อกำหนดเบื้องต้นสำหรับความไว้วางใจ ไม่ใช่สิ่งที่ต้องคำนึงถึงในภายหลัง
แนวทางที่แตกต่างในทุ่งที่มีผู้คนหนาแน่น
สำหรับคู่แข่ง Patronus เชื่อว่าส่วนใหญ่จะแข่งขันกับทีมประเมินภายในที่ห้องปฏิบัติการ AI สร้างขึ้นเพื่อประเมินพฤติกรรมของตัวแทน ในขณะที่บริษัทข้อมูลมนุษย์ เช่น Mercor และ Surge ช่วยเหลือผู้สร้างโมเดลด้วยการเรียนรู้แบบเสริมกำลัง Patronus ดำเนินการแตกต่างออกไปโดยการประเมินว่าเจ้าหน้าที่มีพฤติกรรมอย่างไรโดยไม่ต้องมีส่วนร่วมของมนุษย์ ทำให้การตรวจจับความล้มเหลวโดยอัตโนมัติซึ่งอาจต้องใช้การตรวจสอบด้วยตนเองที่มีราคาแพง
การระดมทุนรอบดังกล่าวเป็นการส่งสัญญาณความเชื่อมั่นของนักลงทุนว่าการประเมินตัวแทนจะกลายเป็นชั้นพื้นฐานของกลุ่ม AI ในขณะที่ตัวแทนทำงานแบบอิสระมากขึ้น ตั้งแต่การจองทริปไปจนถึงการวิเคราะห์ทางการเงิน สตาร์ทอัพที่สามารถพิสูจน์ได้ว่าระบบเหล่านั้นเชื่อถือได้ก่อนที่จะนำไปใช้งาน กำลังวางตำแหน่งตัวเองเป็นผู้เฝ้าประตูที่ขาดไม่ได้ในยุค AI ตัวแทน
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →


