Amazon Web Services ได้เปิดตัว Amazon Bedrock AgentCore Evaluesment ซึ่งเป็นความสามารถใหม่ที่ให้คะแนนเอเจนต์ AI ที่สร้างขึ้นด้วยเฟรมเวิร์กหลักใดๆ ไม่ใช่แค่เครื่องมือของ AWS เท่านั้น โดยถือว่าการติดตาม OpenTelemetry เป็นอินเทอร์เฟซสากลสำหรับการประเมิน การประกาศดังกล่าวเกิดขึ้นในบล็อกโพสต์การเรียนรู้ของเครื่อง AWS ที่เผยแพร่เมื่อวันที่ 26 สิงหาคมโดย Swarnim Singhal, Bharathi Srinivasan และ Renya Kujirada
การเสนอขายกล่าวถึงสิ่งที่ AWS เรียกว่าความไม่สมดุลที่น่าหงุดหงิดในงาน AI ที่ใช้งานจริง: ความหลากหลายของเฟรมเวิร์กเอเจนต์เติบโตขึ้นเรื่อยๆ ในขณะที่เครื่องมือการประเมินผลยังตามไม่ทัน เพื่อให้ทันกับ วงจรข่าวอุตสาหกรรม AI ที่กว้างขึ้น ขณะนี้ทีมต่างๆ จึงผสมผสานและจับคู่เครื่องมือต่างๆ เป็นประจำ ซึ่งเป็นจุดที่กระบวนการประเมินแบบเดิมๆ แตกสลาย
ปัญหาการแยกส่วน
ขณะที่ทีม AWS วางกรอบ ระบบการประเมินส่วนใหญ่ถือว่าคุณสร้างเอเจนต์ด้วยวิธีเฉพาะเจาะจง: SDK เฉพาะ ไคลเอ็นต์โมเดลภาษาขนาดใหญ่เฉพาะ และรูปแบบการติดตามเฉพาะ ก้าวออกจากโซนความเข้ากันได้ที่แคบนั้น และไปป์ไลน์การประเมินก็พัง
สแต็คในโลกแห่งความเป็นจริงไม่ค่อยอยู่ในเลนของผู้ขายรายเดียว ในบัญชีของโพสต์บล็อก ทีมจะสร้างบน LangGraph สำหรับการจัดการเวิร์กโฟลว์ บน LlamaIndex สำหรับการบูรณาการไปป์ไลน์การดึงข้อมูลที่แน่นหนา และบน OpenAI Agents SDK เมื่อองค์กรสร้างมาตรฐานในโมเดล GPT พวกเขาใช้ Google ADK สำหรับการประสานงานหลายเอเจนต์ หรือ Claude Agent SDK สำหรับความสามารถ Anthropic แบบเนทีฟ และเข้าถึง Strands Agent เมื่อลูปที่ขับเคลื่อนด้วยโมเดลสามารถรับเอเจนต์ที่ทำงานบน Amazon Bedrock AgentCore ได้ในไม่กี่นาที แทนที่จะเป็นวัน
แต่ละเฟรมเวิร์กเหล่านั้นจะสร้างการนำเสนอภายในของตัวเองเกี่ยวกับสิ่งที่ตัวแทนทำ เช่น การเรียกเครื่องมือ การดึงข้อมูล การแฮนด์ออฟระหว่างตัวแทนย่อย ในอดีต การประเมินสิ่งเหล่านี้หมายถึงการสร้างเครื่องมือขึ้นมาใหม่สำหรับแต่ละรายการ หรือการยอมรับว่าบางเฟรมเวิร์กไม่สามารถให้คะแนนได้เลย
มันทำงานอย่างไร: การวัดและส่งข้อมูลทางไกลผ่านการเชื่อมต่อแบบแน่น
การประเมิน AgentCore พยายามที่จะยุติการเชื่อมต่อนั้นโดยการเลือกอินเทอร์เฟซที่ทุกเฟรมเวิร์กหลักพูดอยู่แล้ว เกือบทั้งหมดรองรับ OpenTelemetry ไม่ว่าจะโดยธรรมชาติหรือผ่านไลบรารีเครื่องมือวัดของชุมชน ซึ่งเป็นมาตรฐานโดยพฤตินัยที่เครื่องมือสังเกตบนคลาวด์และแอปพลิเคชันมาบรรจบกันเมื่อหลายปีก่อน
ตรรกะนั้นตรงไปตรงมา: ตราบใดที่การวัดและส่งข้อมูลทางไกลของตัวแทนไหลผ่าน OpenTelemetry บริการประเมินผลก็สามารถให้คะแนนได้ ไม่ว่า SDK จะอยู่ข้างใต้ก็ตาม โพสต์ในบล็อกจะอธิบายเกี่ยวกับการวัดและส่งข้อมูลทางไกลที่บริการอ่าน วิธีตัดสินใจว่าจะตีความช่วงอย่างไร คุณลักษณะใดที่มีข้อมูลการประเมิน และวิธีที่ความครอบคลุมขยายไปยังเฟรมเวิร์กที่อยู่นอกเหนือรายการที่มีชื่อของ AWS — สร้างรูปแบบอย่างมีประสิทธิภาพ แทนที่จะเป็นเฟรมเวิร์ก หรือสัญญา
สำหรับองค์กรด้านวิศวกรรม การดำเนินการนี้จะเปลี่ยนการประเมินให้เป็นการตัดสินใจเกี่ยวกับโครงสร้างพื้นฐาน แทนที่จะเป็นการสร้างต่อโครงการ ตัวแทนที่ให้คะแนนในวันที่จัดส่งสามารถนำมาเปรียบเทียบกับเกณฑ์ชี้วัดเดียวกัน ไม่ว่าผู้เขียนจะเขียนไว้ใน LangGraph หรือ Claude Agent SDK ก็ตาม
มันเหมาะกับ AgentCore ตรงไหน
ช่องการประเมินผลในแพลตฟอร์ม Amazon Bedrock AgentCore ที่กว้างกว่า ซึ่งรันไทม์จัดการโฮสติ้ง การปรับขนาด หน่วยความจำ และโครงสร้างพื้นฐานความสามารถในการสังเกตอยู่แล้ว ซึ่งนักพัฒนาอาจสร้างขึ้นใหม่สำหรับแต่ละโปรเจ็กต์ ด้วยการเพิ่มการประเมินในพื้นที่เดียวกัน AWS กำลังรวบรวมจำนวนวงจรการใช้งานทั้งหมดสำหรับเอเจนต์: ปรับใช้บนรันไทม์ ดูผ่านความสามารถในการสังเกตในตัว และตอนนี้วัดตามเกณฑ์ที่สอดคล้องกันโดยไม่ต้องออกจากแพลตฟอร์ม
จังหวะเวลาไม่ใช่เรื่องบังเอิญ ทั่วทั้งอุตสาหกรรม คำถามเกี่ยวกับว่าตัวแทนประพฤติตามที่ตั้งใจจริงหรือไม่ ได้เปลี่ยนจากความกังวลด้านวิชาการไปสู่ความเสี่ยงระดับคณะกรรมการ ตามเหตุการณ์ที่มีชื่อเสียง เช่น พฤติกรรมที่ไม่เหมาะสมที่ประสานงานกันซึ่งบันทึกไว้ในการสืบสวนการละเมิด Hugging Face และหลักฐานที่เพิ่มขึ้นว่าการวัดประสิทธิภาพเพียงอย่างเดียววาดภาพความน่าเชื่อถือของตัวแทนที่ไม่สมบูรณ์ เครื่องมือที่ทำให้การประเมินผลมีความต่อเนื่อง ราคาถูก และไม่ขึ้นอยู่กับกรอบงาน บ่งบอกถึงความกังวลนั้นโดยตรง
ทำไมมันถึงสำคัญ
การประเมินกลายเป็นคอขวดของการยอมรับตัวแทนองค์กรอย่างเงียบ ๆ ความเร็วของการพัฒนาไม่ใช่ข้อจำกัดอีกต่อไป ข้อจำกัดคือความมั่นใจ: การรู้ว่าตัวแทนที่ตอบรับลูกค้า การย้ายข้อมูล หรือดำเนินการเวิร์กโฟลว์จะดำเนินการอย่างถูกต้องภายใต้เงื่อนไขที่ไม่มีการทดสอบเป็นรายบุคคล
ด้วยการยึดการประเมินเข้ากับ OpenTelemetry แทนที่จะเป็น SDK ใด ๆ AWS เดิมพันว่าฉันทามติด้านความสามารถในการสังเกตของอุตสาหกรรมสามารถเพิ่มเป็นสองเท่าของชั้นการประกันคุณภาพได้ ไม่ว่าคู่แข่งจะปฏิบัติตามด้วยการให้คะแนนแบบไม่เชื่อเรื่องกรอบการทำงานที่เท่ากันหรือไม่ก็ตาม จะบอกได้มากเกี่ยวกับความเร็วของ AI แบบตัวแทนที่เติบโตจากการสาธิตไปสู่โครงสร้างพื้นฐานที่เชื่อถือได้
สำหรับทีมที่ใช้ฟลีตต่างกัน ความหมายเชิงปฏิบัติคือความสามารถในการเปรียบเทียบได้ เมื่อตัวแทนทุกรายรายงานในรูปแบบการวัดและส่งข้อมูลทางไกลเดียวกัน คุณภาพจะกลายเป็นสิ่งที่องค์กรสามารถติดตามได้ตลอดเวลาและทั่วทั้งทีม แทนที่จะรับมาใหม่ต่อโปรเจ็กต์ ซึ่งเป็นเงื่อนไขเบื้องต้นสำหรับสิ่งใดก็ตามที่คล้ายคลึงกับความพร้อมในการปฏิบัติงานในระบบตัวแทน สำหรับองค์กรที่อยู่ลึกเข้าไปในสแต็กไฮบริดของ LangGraph-LlamaIndex หรือเพียงแค่ระวังการเขียนเครื่องมือใหม่ทุกครั้งที่มีเฟรมเวิร์กที่ดีกว่าปรากฏขึ้น ขณะนี้มีตัวเลือกบุคคลที่หนึ่งจากผู้ให้บริการคลาวด์ของตนที่ไม่ขอให้พวกเขาเลือกข้าง
---
ก้าวนำหน้า AIรับข่าวสาร AI การวิเคราะห์ และความก้าวหน้าล่าสุด ทั้งหมดในที่เดียว
อ่านข่าว AI เพิ่มเติม →