Microsoft Research telah mengeluarkan Orchard, rangka kerja sumber terbuka untuk membina, melatih dan menilai ejen AI autonomi yang dikatakan syarikat itu membolehkan model berat terbuka yang agak kecil mendekati prestasi sistem sempadan lebih daripada sepuluh kali ganda saiznya. Projek itu, yang diperincikan dalam catatan blog pada 3 Ogos 2026, merupakan bidaan paling bercita-cita tinggi syarikat itu untuk memberikan komuniti penyelidikan yang lebih luas jenis infrastruktur yang, sehingga kini, sebahagian besarnya kekal terkunci di dalam makmal proprietari.
Keluaran itu tiba apabila industri AI beralih daripada menjawab soalan statik kepada ejen yang boleh merancang, menaakul dan bertindak merentas persekitaran berbilang langkah. Untuk mendapatkan maklumat lanjut tentang cara bidang itu bergerak ke arah sistem autonomi, lihat [liputan industri AI terkini] kami(https://aibuzzwire.news).
Apa itu Orchard sebenarnya
Di tengah-tengah projek ini ialah Orchard Env, perkhidmatan persekitaran berasaskan Kubernetes yang ringan yang menyediakan komponen terpencil yang boleh digunakan semula untuk menjalankan ejen pada skala. Menurut Microsoft, perkhidmatan yang sama boleh menyokong ejen kejuruteraan perisian, ejen penyemakan imbas web dan ejen pembantu peribadi tanpa pengubahsuaian. Ia mengendalikan segala-galanya daripada mengumpul data latihan kepada pelancaran dan penilaian pembelajaran pengukuhan.
Keputusan seni bina utama ialah persekitaran masa jalan dianggap sebagai perkhidmatan kendiri yang boleh diguna semula dan bukannya infrastruktur yang tertanam dalam rangka kerja latihan tertentu. Oleh kerana Orchard Env terletak di Kubernetes, ia boleh mencipta, mengurus dan mengalih keluar beribu-ribu bekas terpencil secara selari. Pasukan boleh memperkenalkan penanda aras baharu, sistem ejen atau algoritma latihan tanpa membina semula infrastruktur asas dari awal.
Latihan dalam abah-abah sebenar
Salah satu ciri yang membezakan Orchard ialah keupayaannya untuk melatih ejen secara langsung di dalam abah-abah penggunaan yang sebenarnya mereka akan gunakan dalam pengeluaran. Ejen yang paling berkebolehan hari ini jarang dijalankan sebagai model telanjang. Mereka beroperasi melalui abah-abah canggih seperti Codex, OpenClaw dan ZeroClaw yang menguruskan penaakulan berbilang pusingan, penggunaan alat dan sambungan ke sistem luaran.
Alat latihan terbuka biasanya tidak dapat mengendalikan abah-abah berbilang proses yang berstatus ini, memaksa penyelidik untuk berlatih secara stand-in yang dipermudahkan dan kemudian menggunakan tetapan sebenar, yang mewujudkan ketidakpadanan antara latihan dan penggunaan. Orchard menutup jurang ini: proksi ringan merekodkan panggilan model abah-abah sendiri sebagai data latihan manakala setiap pelancaran dijalankan dalam bekasnya sendiri, membolehkan ejen dilatih secara langsung dari hujung ke hujung dalam abah-abah yang akan digunakan dalam pengeluaran.
Tiga resipi khusus domain
Untuk menunjukkan pendekatan, Microsoft mengeluarkan tiga aliran kerja latihan.
Orchard-SWE: kejuruteraan perisian
Orchard-SWE menyasarkan salah satu tetapan yang paling mencabar untuk ejen autonomi: penaakulan pelbagai langkah ke atas pangkalan kod sebenar. Ia dibina menggunakan rangka kerja Mini-SWE-Agent dan dinilai pada SWE-bench Verified, penanda aras yang menguji keupayaan model untuk menavigasi, mendiagnosis dan membaiki pangkalan kod dunia sebenar.
Untuk melatih sistem, Microsoft menyuling 107,000 interaksi ejen daripada dua model berat terbuka termaju, MiniMax-M2.5 dan Qwen3.5-397B, meliputi pelbagai isu GitHub. Menggunakan teknik yang dipanggil penyeliaan penyeliaan kredit, sistem belajar daripada bahagian produktif percubaan separa dan bukannya membuangnya sepenuhnya.
Hasilnya memindahkan model daripada garis dasar 61.4% pada SWE-bench Verified kepada 69.1% dengan pembelajaran pengukuhan, dan 69.7% dengan teknik ganjaran padat. Dengan penyusunan semula model nilai, angka itu mencecah 73.0% — keadaan seni baharu dalam kalangan model sumber terbuka dengan saiz yang setanding, menggunakan hanya kira-kira 3 bilion parameter aktif.
Orchard-GUI: navigasi web
Orchard-GUI melatih model bahasa penglihatan 4 bilion parameter sebagai ejen penyemak imbas. Walaupun menggunakan jumlah penyeliaan yang agak kecil — 400 demonstrasi suling digabungkan dengan 2,200 tugas latihan terbuka — model itu mencapai 74.1% pada WebVoyager, 67.0% pada Online-Mind2Web dan 64.0% pada DeepShop, dengan purata 68.4%. Microsoft berkata keputusan ini meletakkannya antara ejen web sumber terbuka terkuat setakat ini.
Orchard-Claw: tugas pembantu peribadi
Orchard-Claw memfokuskan pada tugas produktiviti harian seperti membaca dan mendraf e-mel, mengurus kalendar dan mencari maklumat. Dilatih pada hanya 200 tugasan sintetik dan dinilai pada penanda aras Claw-Eval, ia menyelesaikan 59.6% tugasan yang diberikan sehingga tiga percubaan, meningkat kepada 73.9% apabila dipasangkan dengan sistem ejen ZeroClaw yang lebih kuat.
Mengapa keputusan model kecil penting
Nombor penanda aras adalah ketara kerana ia datang daripada model dengan kira-kira 3 hingga 4 bilion parameter aktif — jauh lebih kecil daripada sistem sempadan daripada OpenAI, Anthropic dan Google yang mendominasi papan pendahulu. Hujah Microsoft ialah infrastruktur dan persekitaran latihan yang betul boleh menutup banyak jurang, menjadikan sistem agen yang berkebolehan boleh diakses oleh penyelidik dan organisasi yang tidak mampu untuk melatih atau menjalankan model proprietari terbesar.
Di samping model dan aliran kerja, Microsoft mengeluarkan data latihan dan kaedah penilaian yang digunakan untuk membinanya, dengan matlamat yang dinyatakan untuk membantu komuniti penyelidikan yang lebih luas membina dan mengkaji sistem agenik terbuka. Kerja ini diketuai oleh Baolin Peng, Wenlin Yao, Qianhui Wu, Hao Cheng, dan Jianfeng Gao dari Microsoft Research.
Kekal Mendahului AI
Keluaran Orchard Microsoft memberi isyarat bahawa infrastruktur di sebalik AI ejen sempadan mula berdemokrasi. Baca lebih lanjut berita terbaharu AI dan Baca lebih banyak berita AI →
