Microsoft Research wis ngrilis Orchard, kerangka open-source kanggo mbangun, nglatih, lan ngevaluasi agen AI otonom sing perusahaan ujar ngidini model bobot mbukak sing relatif cilik nyedhaki kinerja sistem perbatasan luwih saka sepuluh kaping ukurane. Proyèk kasebut, kanthi rinci ing kiriman blog tanggal 3 Agustus 2026, minangka tawaran paling ambisius saka perusahaan kanggo menehi komunitas riset sing luwih jembar babagan infrastruktur sing, nganti saiki, umume tetep dikunci ing laboratorium kepemilikan.

Rilis kasebut teka nalika industri AI pindhah saka jawaban pitakonan statis menyang agen sing bisa ngrancang, alasan, lan tumindak ing lingkungan multistep. Kanggo luwih lengkap babagan cara lapangan maju menyang sistem otonom, deleng [jangkoan industri AI paling anyar] (https://aibuzzwire.news).

Apa sejatine Orchard

Ing tengah proyek kasebut yaiku Orchard Env, layanan lingkungan berbasis Kubernetes sing entheng sing nyedhiyakake komponen sing bisa digunakake maneh lan diisolasi kanggo agen sing mlaku kanthi skala. Miturut Microsoft, layanan sing padha bisa ndhukung agen rekayasa piranti lunak, agen browsing web, lan agen asisten pribadi tanpa modifikasi. Nangani kabeh saka ngumpulake data latihan nganti rollout lan evaluasi pembelajaran penguatan.

Kaputusan arsitektur utama yaiku lingkungan runtime dianggep minangka layanan mandiri lan bisa digunakake maneh tinimbang infrastruktur sing dipasang ing kerangka latihan tartamtu. Amarga Orchard Env lenggah ing Kubernetes, bisa nggawe, ngatur, lan mbusak ewonan wadhah terisolasi kanthi paralel. Tim bisa ngenalake pathokan anyar, sistem agen, utawa algoritma latihan tanpa mbangun maneh infrastruktur dhasar saka awal.

Latihan ing sabuk nyata

Salah sawijining fitur sing mbedakake Orchard yaiku kemampuan kanggo nglatih agen langsung ing sabuk penyebaran sing bakal digunakake ing produksi. Agen sing paling mumpuni ing jaman saiki jarang dadi model telanjang. Padha operate liwat harnesses canggih kayata Codex, OpenClaw, lan ZeroClaw sing ngatur multi-turn nalar, nggunakake alat, lan sambungan menyang sistem external.

Piranti latihan mbukak biasane ora bisa nangani stateful, multi-proses harnesses iki, meksa peneliti kanggo olahraga ing simplified stand-in lan banjur masang ing setelan nyata, kang nggawe mismatch antarane latihan lan penyebaran prajurit. Orchard nutup celah iki: proxy sing entheng nyathet telpon model sabuk dhewe minangka data latihan nalika saben rollout mlaku ing wadhah dhewe, ngidini agen bisa dilatih langsung ing sabuk sing bakal digunakake ing produksi.

Telung resep khusus domain

Kanggo nduduhake pendekatan kasebut, Microsoft ngeculake telung alur kerja latihan.

Orchard-SWE: software engineering

Orchard-SWE ngarahake salah sawijining setelan sing paling nuntut kanggo agen otonom: pertimbangan multi-langkah liwat basis kode nyata. Iki dibangun nggunakake kerangka Mini-SWE-Agent lan dievaluasi ing SWE-bench Verified, pathokan sing nguji kemampuan model kanggo navigasi, diagnosa, lan ndandani basis kode ing donya nyata.

Kanggo nglatih sistem kasebut, Microsoft nyuling 107.000 interaksi agen saka rong model bobot mbukak maju, MiniMax-M2.5 lan Qwen3.5-397B, sing nyakup macem-macem masalah GitHub. Nggunakake teknik sing disebut kredit-tugas diawasi fine-tuning, sistem sinau saka bagean produktif saka nyoba parsial tinimbang discarding kabeh.

Asil mindhah model saka 61,4% baseline ing SWE-bench Verified kanggo 69,1% karo learning penguatan, lan 69,7% karo Techniques kandhel-ganjaran. Kanthi reranking model nilai, angka kasebut tekan 73,0% - negara anyar ing antarane model open-source kanthi ukuran sing padha, mung nggunakake udakara 3 milyar parameter aktif.

Orchard-GUI: pandhu arah web

Orchard-GUI nglatih model vision-language 4 milyar parameter minangka agen browser. Senadyan nggunakake jumlah pengawasan sing relatif cilik - 400 demonstrasi disuling digabungake karo 2,200 tugas latihan sing mbukak - model kasebut entuk 74,1% ing WebVoyager, 67,0% ing Online-Mind2Web, lan 64,0% ing DeepShop, kanthi rata-rata 68,4%. Microsoft ujar manawa asil kasebut kalebu ing antarane agen web sumber terbuka sing paling kuat nganti saiki.

Orchard-Claw: tugas asisten pribadi

Orchard-Claw fokus ing tugas produktivitas saben dina kaya maca lan ngrancang email, ngatur tanggalan, lan nggoleki informasi. Dilatih mung 200 tugas sintetik lan dievaluasi ing pathokan Claw-Eval, ngrampungake 59,6% tugas sing diwenehake nganti telung upaya, mundhak dadi 73,9% nalika dipasangake karo sistem agen ZeroClaw sing luwih kuat.

Apa asil model cilik penting

Nomer pathokan kasebut misuwur amarga asale saka model kanthi kira-kira 3 nganti 4 milyar paramèter aktif - luwih cilik tinimbang sistem frontier saka OpenAI, Anthropic, lan Google sing ndominasi papan peringkat. Argumentasi Microsoft yaiku yen infrastruktur lan lingkungan latihan sing tepat bisa nutup akeh jurang, nggawe sistem agen sing bisa diakses para peneliti lan organisasi sing ora bisa nglatih utawa mbukak model proprietary paling gedhe.

Saliyane model lan alur kerja, Microsoft ngrilis data latihan lan cara evaluasi sing digunakake kanggo mbangun, kanthi tujuan kanggo mbantu komunitas riset sing luwih jembar mbangun lan nyinaoni sistem agen terbuka. Karya kasebut dipimpin dening Baolin Peng, Wenlin Yao, Qianhui Wu, Hao Cheng, lan Jianfeng Gao saka Microsoft Research.

Tetep Ahead saka AI

Microsoft's Orchard rilis sinyal manawa infrastruktur ing mburi AI agen perbatasan wiwit demokratisasi. Waca liyane kabar AI bubar lan Waca warta AI liyane →