Inception Labs ngrilis Mercury 2.5 ing dina Selasa, versi anyar saka model basa difusi komersial sing diterangake perusahaan minangka LLM difusi paling apik ing pasar lan, miturut kawruhe, model basa difusi paling gedhe sing wis dilatih. Miturut woro-woro perusahaan, model kasebut nambah intelijen 40% tinimbang sing sadurunge, Mercury 2, nalika nahan profil latensi sing murah lan murah sing nggawe arsitektur difusi narik kawigaten kanggo beban kerja sing akeh.

Perusahaan kasebut, sing dipimpin dening CEO Stefano Ermon, nyatakake Mercury 2.5 bisa dibandhingake karo model perbatasan sing dioptimalake biaya kalebu GPT-5.6 Luna (Low), Gemini 3.5 Flash-Lite lan Claude Haiku 4.5. Bandhingan kasebut dilaporake vendor lan durung diverifikasi dening benchmarks independen, nanging padha posisi model difusi - suwene penasaran riset - minangka alternatif produksi kanggo incumbents autoregressive. Kanggo warta model AI paling anyar, tututi liputan model AI Buzz Wire sing isih ana. kabar model AI paling anyar

Kacepetan, Konteks lan Rega

Nomer judhul sing agresif. Inception Labs ujar Mercury 2.5 ngasilake 1,107 token per detik ing GPU NVIDIA sing kasedhiya, kanthi jendela konteks 260,000 token. Rega disetel ing $0.20 saben yuta token input lan $0.75 saben yuta token output, karo promosi peluncuran diskon model 80% kanggo $0.04 saben yuta input lan $0.15 saben yuta output.

Ing sisih kapabilitas, model kasebut dikirim kanthi pertimbangan sing bisa ditrapake - ngidini para pangembang dagang latensi kanthi jero saben panjaluk - bebarengan karo panggilan alat paralel lan output JSON sing disusun skema kanggo generasi terstruktur. Perusahaan kasebut nggawe rilis kasebut minangka asil pertama saka loop latihan sing didorong dening telemetri produksi: wiwit Mercury 2 diluncurake, ewonan pangembang wis dibangun, puluhan perusahaan wis nyebarake, lan panggunaan saya mundhak luwih saka urutan gedhene.

Napa Model Difusi Ngasilake Teks Luwih Cepet

LLM mainstream saka OpenAI, Google lan Anthropic minangka autoregresif: ngasilake teks siji-sijine, kanthi saben token dikondisikake ing kabeh sing digawe sadurunge. Ketergantungan sekuensial kasebut ndadekake lantai hard ing kacepetan generasi. Model basa panyebaran tinimbang diwiwiti kanthi pamblokiran gangguan lan nyaring kabeh token kanthi paralel, sing ngidini throughput sing luwih dhuwur ing hardware GPU konvensional yen model kasebut dilatih kanggo nggabungake kanthi resik.

Trade-off wis historis kualitas: model panyebaran wis trailed gedhe-gedhe autoregressive ing nalar lan instruction-follow benchmarks. Taruhan inti Inception Labs - lan pratelan sing ndasari Mercury 2.5 - yaiku jurang iki wis sempit nganti titik difusi menang ing sumbu sing paling dirasakake para pelanggan: latensi lan biaya ing volume produksi.

Klaim Produksi Saka Pelanggan Awal

Pengumuman kasebut gumantung banget marang panyebaran pelanggan tinimbang tabel benchmark. OpenCall, sing nggawe agen telpon AI kanggo telpon pelanggan langsung, nglaporake manawa pindhah menyang Mercury nggawa latensi respon model median nganti kira-kira 170 milidetik. Oliver Silverstein, co-founder lan CEO OpenCall kang, ngandika wektu nanggepi P99 perusahaan dropped saka sawetara menit kanggo siji detik, lan belekan saka 0,4 detik kanggo ing 0,2 - tokoh kang diterangake minangka Ngartekno luwih cepet saka panyedhiya liyane perusahaan wis dites, kalebu karo alesan aktif.

Augment Code, pembuat asisten coding AI, nggunakake Mercury kanggo pemadatan konteks, rute model lan telusuran alat MCP. Miturut Inception Labs, mindhah beban kerja pemadatan menyang Mercury nyuda latensi langkah kasebut kanthi 82%, saka kira-kira 150 detik dadi 27 detik, lan nyuda biaya nganti 90% nalika njaga kualitas. Kasus panggunaan nggambarake endi ekonomi: agen pengkodean nggawe akeh model dhukungan cilik ing saben generasi utami, lan latensi lan senyawa biaya ing telpon kasebut.

NVIDIA, kang hardware nganggo model, uga ditimbang ing. Shruti Koparkar, manager senior produk ing NVIDIA kang Accelerated Computing Group, ngandika Inception wis maju model basa basis difusi ing infrastruktur NVIDIA AI, lan sing Mercury 2.5 kualitas langkah-munggah karo kacepetan bablas nuduhake carane cepet arsitektur anyar bisa diwasa menyang sistem produksi-siap.

Mercury Voice lan Mercury Router Pratinjau

Saliyane model kasebut, Inception Labs ngumumake pratinjau rong produk anyar. Mercury Voice minangka LLM difusi sing dioptimalake kanggo agen swara kanthi anggaran latensi paling ketat, iklan wektu-kanggo-pisanan ing sangisore 170 milidetik. Router Mercury nggunakake model difusi kanggo mangerteni pituduh sing mlebu lan nuntun menyang model apa wae - mbukak utawa ditutup - nawakake campuran kualitas, kacepetan lan biaya sing paling apik, posisi Inception minangka lapisan ing ndhuwur pesaing lan uga salah sijine.

Mercury 2.5 kasedhiya liwat API Inception dhewe uga liwat Baseten lan OpenRouter. Penyebaran perusahaan nambah kapasitas khusus, autoscaling, kontrol kepatuhan lan retensi data sing bisa dikonfigurasi. Perusahaan nawakake 100 yuta token gratis kanggo pangembang nyoba API.

Perusahaan kasebut uga ujar manawa wis miwiti latihan model sabanjure - sing paling gedhe, ditargetake bakal diluncurake ing wulan-wulan sing bakal teka - sing digambarake minangka lompatan ing kemampuan sing ora menehi kecepatan difusi utawa efisiensi token. Yen pratelan kasebut tetep, tekanan ing incumbents autoregressive bakal dirasakake dhisik ing tingkatan komoditas pasar, ing ngendi rega lan latensi mutusake paling akeh kontrak.

Tetep Ahead of AI

Tindakake pangembangan AI paling anyar lan warta intelijen buatan nalika arsitektur model anyar dadi produksi.

Waca liyane warta AI →