Inception Labs mengeluarkan Mercury 2.5 pada hari Selasa, versi baharu model bahasa resapan komersilnya yang disifatkan syarikat sebagai LLM resapan paling berkebolehan di pasaran dan, pada pengetahuannya, model bahasa resapan terbesar yang pernah dilatih. Menurut pengumuman syarikat itu, model itu memberikan peningkatan 40% dalam kecerdasan berbanding pendahulunya, Mercury 2, sambil mengekalkan kependaman rendah, profil penyajian kos rendah yang sama yang telah menjadikan seni bina resapan menarik untuk beban kerja volum tinggi.

Syarikat itu, yang diketuai oleh Ketua Pegawai Eksekutif Stefano Ermon, mendakwa Mercury 2.5 adalah setanding dengan model sempadan yang dioptimumkan kos termasuk GPT-5.6 Luna (Rendah), Gemini 3.5 Flash-Lite dan Claude Haiku 4.5. Perbandingan tersebut dilaporkan vendor dan belum lagi disahkan oleh penanda aras bebas, tetapi ia meletakkan model resapan — lama rasa ingin tahu penyelidikan — sebagai alternatif pengeluaran kepada penyandang autoregresif. Untuk berita model AI terkini, ikuti liputan model berterusan AI Buzz Wire. berita model AI terkini

Kelajuan, Konteks dan Harga

Nombor tajuk adalah agresif. Inception Labs mengatakan Mercury 2.5 menjana 1,107 token sesaat pada GPU NVIDIA yang tersedia secara meluas, dengan tetingkap konteks sebanyak 260,000 token. Harga ditetapkan pada $0.20 setiap juta token input dan $0.75 setiap juta token keluaran, dengan promosi pelancaran mendiskaun model 80% kepada $0.04 setiap juta input dan $0.15 setiap juta output.

Dari segi keupayaan, model ini dihantar dengan penaakulan yang boleh disesuaikan — membenarkan pembangun menukar kependaman untuk kedalaman berdasarkan setiap permintaan — bersama-sama dengan panggilan alat selari dan output JSON yang diselaraskan skema untuk penjanaan berstruktur. Syarikat itu merangka keluaran itu sebagai hasil pertama gelung latihan yang didorong oleh telemetri pengeluaran: sejak Mercury 2 dilancarkan, beribu-ribu pembangun telah membina dengannya, berpuluh-puluh perusahaan telah menggunakannya, dan penggunaan telah berkembang lebih daripada satu susunan magnitud.

Mengapa Model Penyebaran Menjana Teks Lebih Cepat

LLM arus perdana daripada OpenAI, Google dan Anthropic adalah autoregresif: mereka menjana teks satu token pada satu masa, dengan setiap token dikondisikan pada semua yang dijana sebelum itu. Kebergantungan berurutan itu meletakkan lantai keras di bawah kelajuan penjanaan. Model bahasa resapan sebaliknya bermula dengan blok hingar dan secara berulang memperhalusi semua token secara selari, yang membolehkan daya pemprosesan yang jauh lebih tinggi pada perkakasan GPU konvensional sebaik sahaja model dilatih untuk menumpu dengan bersih.

Pertukaran itu dari segi sejarah adalah berkualiti: model penyebaran telah mengekori model autoregresif pada penaakulan dan penanda aras mengikut arahan. Pertaruhan teras Inception Labs — dan dakwaan yang mendasari Mercury 2.5 — ialah jurang ini telah mengecil ke tahap di mana penyebaran menang pada paksi yang sebenarnya dirasakan oleh kebanyakan pelanggan: kependaman dan kos pada volum pengeluaran.

Tuntutan Pengeluaran Daripada Pelanggan Awal

Pengumuman ini sangat bergantung pada penempatan pelanggan dan bukannya jadual penanda aras. OpenCall, yang membina ejen telefon AI untuk panggilan pelanggan secara langsung, melaporkan bahawa berpindah ke Mercury membawa kependaman tindak balas model mediannya kepada kira-kira 170 milisaat. Oliver Silverstein, pengasas bersama dan Ketua Pegawai Eksekutif OpenCall, berkata masa tindak balas P99 syarikat menurun daripada beberapa minit kepada satu saat, dan mediannya daripada 0.4 saat kepada di bawah 0.2 — angka yang beliau gambarkan sebagai jauh lebih pantas daripada mana-mana pembekal lain yang telah diuji oleh syarikat, termasuk dengan penaakulan yang didayakan.

Augment Code, pembuat pembantu pengekodan AI, menggunakan Mercury untuk pemadatan konteks, penghalaan model dan carian alat MCP. Menurut Inception Labs, memindahkan beban kerja pemadatan ke Mercury mengurangkan kependaman langkah itu sebanyak 82%, daripada kira-kira 150 saat kepada 27 saat dan mengurangkan kosnya sebanyak 90% sambil mengekalkan kualiti. Kes penggunaan menggambarkan di mana ekonomi menggigit: ejen pengekodan membuat banyak panggilan model sokongan kecil di sekitar setiap generasi utama, dan kependaman serta kompaun kos merentas panggilan tersebut.

NVIDIA, yang perkakasannya menjalankan model itu, turut mengambil berat. Shruti Koparkar, pengurus kanan produk dalam Kumpulan Pengkomputeran Dipercepat NVIDIA, berkata Inception mempunyai model bahasa berasaskan resapan lanjutan pada infrastruktur AI NVIDIA, dan peningkatan kualiti Mercury 2.5 dengan kelajuan yang berterusan menunjukkan betapa cepat seni bina baharu boleh matang menjadi sistem sedia pengeluaran.

Mercury Voice dan Mercury Router Pratonton

Di samping model itu, Inception Labs mengumumkan pratonton dua produk baharu. Mercury Voice ialah LLM penyebaran yang dioptimumkan untuk ejen suara dengan belanjawan kependaman yang paling ketat, mengiklankan token masa ke pertama di bawah 170 milisaat. Penghala Mercury menggunakan model resapan untuk memahami gesaan masuk dan menghalakannya ke mana-mana model — terbuka atau tertutup — menawarkan gabungan kualiti, kelajuan dan kos terbaik, meletakkan Permulaan sebagai lapisan di atas pesaingnya serta salah satu daripadanya.

Mercury 2.5 tersedia melalui API Inception sendiri serta melalui Baseten dan OpenRouter. Penerapan perusahaan menambah kapasiti khusus, penskalaan automatik, kawalan pematuhan dan pengekalan data yang boleh dikonfigurasikan. Syarikat itu menawarkan 100 juta token percuma kepada pembangun yang mencuba API.

Syarikat itu juga berkata ia telah mula melatih model seterusnya - yang terbesar lagi, disasarkan untuk dikeluarkan pada bulan-bulan akan datang - yang disifatkan sebagai lonjakan dalam keupayaan yang tidak memberikan sebarang kelajuan penyebaran atau kecekapan token. Jika tuntutan itu berlaku, tekanan ke atas penyandang autoregresif akan dirasai terlebih dahulu dalam peringkat komoditi pasaran, di mana harga dan kependaman menentukan kebanyakan kontrak.

Kekal Mendahului AI

Ikuti perkembangan AI terkini dan pecahkan berita kecerdasan buatan semasa seni bina model baharu berlumba-lumba ke dalam pengeluaran.

Baca lebih banyak berita AI →