Microsoft Research ได้เปิดตัว Orchard ซึ่งเป็นเฟรมเวิร์กโอเพ่นซอร์สสำหรับการสร้าง การฝึกอบรม และการประเมินตัวแทน AI อัตโนมัติ ซึ่งบริษัทกล่าวว่าช่วยให้โมเดล open-weight ที่ค่อนข้างเล็กเข้าถึงประสิทธิภาพของระบบชายแดนได้มากกว่าสิบเท่า โครงการซึ่งมีรายละเอียดในบล็อกโพสต์เมื่อวันที่ 3 สิงหาคม 2569 ถือเป็นข้อเสนอที่ทะเยอทะยานที่สุดของบริษัทเพื่อให้ชุมชนการวิจัยในวงกว้างมีโครงสร้างพื้นฐานประเภทที่จนถึงขณะนี้ส่วนใหญ่ยังคงถูกขังอยู่ในห้องปฏิบัติการที่เป็นกรรมสิทธิ์

การเปิดตัวดังกล่าวมาถึงในขณะที่อุตสาหกรรม AI เปลี่ยนจากการตอบคำถามแบบคงที่ไปสู่ตัวแทนที่สามารถวางแผน ให้เหตุผล และดำเนินการในสภาพแวดล้อมแบบหลายขั้นตอน หากต้องการข้อมูลเพิ่มเติมว่าวงการนี้เคลื่อนไปสู่ระบบอัตโนมัติอย่างไร โปรดดู การรายงานข่าวอุตสาหกรรม AI ล่าสุด

แท้จริงแล้วออร์ชาร์ดคืออะไร

หัวใจสำคัญของโปรเจ็กต์คือ Orchard Env ซึ่งเป็นบริการสภาพแวดล้อมแบบน้ำหนักเบาบน Kubernetes ที่ให้ส่วนประกอบแบบแยกส่วนที่ใช้ซ้ำได้สำหรับเรียกใช้เอเจนต์ในขนาดต่างๆ ตามข้อมูลของ Microsoft บริการเดียวกันนี้สามารถรองรับตัวแทนวิศวกรรมซอฟต์แวร์ ตัวแทนการท่องเว็บ และตัวแทนผู้ช่วยส่วนตัวโดยไม่มีการดัดแปลง โดยจะจัดการทุกอย่างตั้งแต่การรวบรวมข้อมูลการฝึกอบรมไปจนถึงการเปิดตัวและการประเมินผลการเรียนรู้แบบเสริมกำลัง

การตัดสินใจทางสถาปัตยกรรมที่สำคัญคือสภาพแวดล้อมรันไทม์ถือเป็นบริการแบบสแตนด์อโลนและนำกลับมาใช้ใหม่ได้ แทนที่จะเป็นโครงสร้างพื้นฐานที่ฝังอยู่ภายในเฟรมเวิร์กการฝึกอบรมเฉพาะ เนื่องจาก Orchard Env อยู่บน Kubernetes จึงสามารถสร้าง จัดการ และลบคอนเทนเนอร์ที่แยกออกมานับพันรายการพร้อมกันได้ ทีมสามารถแนะนำเกณฑ์มาตรฐาน ระบบตัวแทน หรืออัลกอริธึมการฝึกอบรมใหม่ๆ ได้โดยไม่ต้องสร้างโครงสร้างพื้นฐานพื้นฐานใหม่ตั้งแต่ต้น

อบรมภายในบังเหียนจริง

คุณสมบัติที่โดดเด่นอย่างหนึ่งของ Orchard คือความสามารถในการฝึกอบรมตัวแทนโดยตรงภายในชุดควบคุมการปรับใช้ที่พวกเขาจะใช้ในการผลิตจริง เจ้าหน้าที่ที่มีความสามารถมากที่สุดในปัจจุบันไม่ค่อยได้ทำงานเป็นโมเดลเปลือยๆ พวกเขาทำงานผ่านชุดควบคุมที่ซับซ้อน เช่น Codex, OpenClaw และ ZeroClaw ที่จัดการการให้เหตุผลแบบหลายรอบ การใช้เครื่องมือ และการเชื่อมต่อกับระบบภายนอก

เครื่องมือการฝึกอบรมแบบเปิดมักจะไม่สามารถจัดการกับชุดควบคุมที่มีสถานะและหลายกระบวนการเหล่านี้ได้ ทำให้นักวิจัยต้องฝึกอบรมแบบสแตนด์อินที่เรียบง่าย จากนั้นจึงปรับใช้ในสภาพแวดล้อมจริง ซึ่งทำให้เกิดความไม่ตรงกันระหว่างการฝึกอบรมและการใช้งาน Orchard ปิดช่องว่างนี้: พร็อกซีน้ำหนักเบาจะบันทึกการเรียกโมเดลของ Harness เองเป็นข้อมูลการฝึกอบรม ในขณะที่การเปิดตัวแต่ละครั้งดำเนินไปในคอนเทนเนอร์ของตัวเอง ช่วยให้ตัวแทนได้รับการฝึกอบรมตั้งแต่ต้นทางถึงปลายทางได้โดยตรงในชุดสายรัดที่จะใช้ในการผลิต

สามสูตรเฉพาะโดเมน

เพื่อสาธิตแนวทางนี้ Microsoft ได้เผยแพร่เวิร์กโฟลว์การฝึกอบรมสามขั้นตอน

Orchard-SWE: วิศวกรรมซอฟต์แวร์

Orchard-SWE กำหนดเป้าหมายหนึ่งในการตั้งค่าที่มีความต้องการมากที่สุดสำหรับตัวแทนอัตโนมัติ: การใช้เหตุผลแบบหลายขั้นตอนเหนือโค้ดเบสจริง สร้างขึ้นโดยใช้เฟรมเวิร์ก Mini-SWE-Agent และได้รับการประเมินบน SWE-bench Verified ซึ่งเป็นเกณฑ์มาตรฐานที่ทดสอบความสามารถของโมเดลในการนำทาง วินิจฉัย และซ่อมแซมโค้ดเบสในโลกแห่งความเป็นจริง

เพื่อฝึกอบรมระบบ Microsoft ได้กลั่นกรองการโต้ตอบของตัวแทน 107,000 รายการจากโมเดล open-weight ขั้นสูงสองรุ่น ได้แก่ MiniMax-M2.5 และ Qwen3.5-397B ซึ่งครอบคลุมปัญหา GitHub ที่หลากหลาย การใช้เทคนิคที่เรียกว่าการปรับแต่งอย่างละเอียดโดยกำกับดูแลการมอบหมายเครดิต ระบบจะเรียนรู้จากส่วนที่มีประสิทธิผลของความพยายามบางส่วน แทนที่จะทิ้งไปทั้งหมด

ผลลัพธ์ได้ย้ายแบบจำลองจากพื้นฐาน 61.4% บน SWE-bench Verified เป็น 69.1% ด้วยการเรียนรู้แบบเสริมกำลัง และ 69.7% ด้วยเทคนิคการให้รางวัลหนาแน่น ด้วยการจัดอันดับโมเดลมูลค่าใหม่ ตัวเลขดังกล่าวสูงถึง 73.0% ซึ่งถือเป็นความล้ำหน้าครั้งใหม่ในบรรดาโมเดลโอเพ่นซอร์สที่มีขนาดใกล้เคียงกัน โดยใช้พารามิเตอร์ที่ใช้งานเพียงประมาณ 3 พันล้านตัวเท่านั้น

Orchard-GUI: การนำทางเว็บ

Orchard-GUI ฝึกฝนโมเดลภาษาวิชั่น 4 พันล้านพารามิเตอร์ในฐานะเอเจนต์เบราว์เซอร์ แม้ว่าจะใช้การควบคุมดูแลค่อนข้างน้อย — การสาธิตกลั่นกรอง 400 ครั้งรวมกับงานฝึกอบรมปลายเปิด 2,200 งาน — โมเดลดังกล่าวประสบความสำเร็จบน WebVoyager 74.1%, Online-Mind2Web 67.0% และ DeepShop 64.0% โดยเฉลี่ย 68.4% Microsoft กล่าวว่าผลลัพธ์เหล่านี้ทำให้เป็นหนึ่งในตัวแทนเว็บโอเพ่นซอร์สที่แข็งแกร่งที่สุดในปัจจุบัน

Orchard-Claw: งานผู้ช่วยส่วนตัว

Orchard-Claw มุ่งเน้นไปที่งานด้านประสิทธิภาพการทำงานในแต่ละวัน เช่น การอ่านและร่างอีเมล การจัดการปฏิทิน และการค้นหาข้อมูล ฝึกฝนงานสังเคราะห์เพียง 200 งานและประเมินตามเกณฑ์มาตรฐาน Claw-Eval โดยทำงานสำเร็จ 59.6% โดยทำได้สูงสุด 3 ครั้ง เพิ่มขึ้นเป็น 73.9% เมื่อจับคู่กับระบบตัวแทน ZeroClaw ที่แข็งแกร่งกว่า

เหตุใดผลลัพธ์ของโมเดลขนาดเล็กจึงมีความสำคัญ

ตัวเลขมาตรฐานมีความโดดเด่นเนื่องจากมาจากโมเดลที่มีพารามิเตอร์ที่ใช้งานอยู่ประมาณ 3 ถึง 4 พันล้านพารามิเตอร์ ซึ่งเล็กกว่าระบบชายแดนจาก OpenAI, Anthropic และ Google ที่ครองลีดเดอร์บอร์ดมาก ข้อโต้แย้งของ Microsoft ก็คือโครงสร้างพื้นฐานและสภาพแวดล้อมการฝึกอบรมที่เหมาะสมสามารถปิดช่องว่างได้มาก ทำให้นักวิจัยและองค์กรต่างๆ สามารถเข้าถึงระบบตัวแทนที่มีความสามารถ ซึ่งไม่สามารถฝึกอบรมหรือใช้งานโมเดลที่เป็นกรรมสิทธิ์ที่ใหญ่ที่สุดได้

นอกเหนือจากโมเดลและเวิร์กโฟลว์แล้ว Microsoft ยังเผยแพร่ข้อมูลการฝึกอบรมและวิธีการประเมินที่ใช้ในการสร้าง โดยมีเป้าหมายที่ระบุไว้ในการช่วยเหลือชุมชนการวิจัยในวงกว้างในการสร้างและศึกษาระบบเอเจนต์แบบเปิด งานนี้นำโดย Baolin Peng, Wenlin Yao, Qianhui Wu, Hao Cheng และ Jianfeng Gao จาก Microsoft Research

ก้าวนำหน้า AI

การเปิดตัว Orchard ของ Microsoft ส่งสัญญาณว่าโครงสร้างพื้นฐานที่อยู่เบื้องหลัง AI เอเจนต์ระดับแนวหน้ากำลังเริ่มทำให้เป็นประชาธิปไตย อ่านเพิ่มเติม ข่าว AI ด่วน และ อ่านข่าว AI เพิ่มเติม →