Inception Labs, şirketin piyasadaki en yetenekli difüzyon LLM'si ve bilgisine göre şimdiye kadar eğitilmiş en büyük difüzyon dili modeli olarak tanımladığı ticari difüzyon dili modelinin yeni bir versiyonu olan Mercury 2.5'i Salı günü piyasaya sürdü. Şirketin duyurusuna göre model, selefi Mercury 2'ye göre zekada %40'lık bir artış sağlarken, aynı zamanda dağıtım mimarisini yüksek hacimli iş yükleri için çekici kılan aynı düşük gecikme süreli, düşük maliyetli hizmet profilini koruyor.

CEO Stefano Ermon liderliğindeki şirket, Mercury 2.5'in GPT-5.6 Luna (Low), Gemini 3.5 Flash-Lite ve Claude Haiku 4.5 dahil olmak üzere maliyet açısından optimize edilmiş öncü modellerle karşılaştırılabilir olduğunu iddia ediyor. Bu karşılaştırmalar satıcılar tarafından raporlanıyor ve henüz bağımsız kıyaslamalarla doğrulanmadı, ancak uzun süredir araştırma merakı olan bir yayılma modelini, otoregresif yerleşiklere bir üretim alternatifi olarak konumlandırıyorlar. En son AI modeli haberleri için AI Buzz Wire'ın devam eden model kapsamını takip edin. en son yapay zeka modeli haberleri

Hız, Bağlam ve Fiyat

Manşet rakamları agresif. Inception Labs, Mercury 2.5'in yaygın olarak bulunan NVIDIA GPU'larda 260.000 tokenlik bir bağlam penceresiyle saniyede 1.107 token ürettiğini söylüyor. Fiyatlandırma, bir milyon giriş tokenı başına 0,20 ABD Doları ve bir milyon çıkış tokenı başına 0,75 ABD Doları olarak belirlendi; lansman promosyonu, modeli milyon girdi başına 0,04 ABD Dolarına ve bir milyon çıktı başına 0,15 ABD Dolarına %80 indirdi.

Yetenek tarafında, model, paralel araç çağrıları ve yapılandırılmış oluşturma için şemaya göre hizalanmış JSON çıktısının yanı sıra, geliştiricilerin istek başına derinlik için gecikmeyi değiştirmesine olanak tanıyan ayarlanabilir akıl yürütmeyle birlikte gelir. Şirket, sürümü üretim telemetrisi tarafından yönlendirilen bir eğitim döngüsünün ilk sonucu olarak çerçeveliyor: Mercury 2'nin piyasaya sürülmesinden bu yana, binlerce geliştirici onu geliştirdi, düzinelerce kuruluş onu kullandı ve kullanım çok büyük bir oranda arttı.

Dağıtım Modelleri Neden Daha Hızlı Metin Oluşturur?

OpenAI, Google ve Anthropic'in ana akım LLM'leri otoregresiftir: her seferinde bir jeton olacak şekilde metin üretirler ve her jeton kendisinden önce oluşturulan her şeye göre koşullanır. Bu sıralı bağımlılık, üretim hızının altında sert bir zemin oluşturuyor. Dağıtım dili modelleri bunun yerine bir gürültü bloğuyla başlar ve tüm belirteçleri paralel olarak yinelemeli olarak iyileştirir; bu, model temiz bir şekilde birleşmek üzere eğitildikten sonra geleneksel GPU donanımında çok daha yüksek verim sağlar.

Takas tarihsel olarak kalite olmuştur: yayılma modelleri, akıl yürütme ve talimat izleme kriterlerinde otoregresif modelleri takip etmiştir. Inception Labs'ın temel iddiası - ve Mercury 2.5'in altında yatan iddia - bu farkın, çoğu müşterinin gerçekte hissettiği eksende yayılmanın kazandığı noktaya kadar daraldığı yönünde: üretim hacminde gecikme ve maliyet.

İlk Müşterilerden Gelen Üretim Talepleri

Duyuru, kıyaslama tablolarından ziyade ağırlıklı olarak müşteri dağıtımlarına dayanıyor. Canlı müşteri çağrıları için yapay zeka telefon temsilcileri oluşturan OpenCall, Mercury'ye geçmenin ortalama model yanıt gecikmesini yaklaşık 170 milisaniyeye çıkardığını bildirdi. OpenCall'ın kurucu ortağı ve CEO'su Oliver Silverstein, şirketin P99 yanıt süresinin birkaç dakikadan bir saniyeye düştüğünü ve ortalamanın 0,4 saniyeden 0,2'nin altına düştüğünü söyledi; bu rakamların, mantık yürütme de dahil olmak üzere, şirketin test ettiği diğer tüm sağlayıcılardan çok daha hızlı olduğunu belirtti.

Yapay zeka kodlama asistanı üreticisi Augment Code, bağlam sıkıştırma, model yönlendirme ve MCP aracı arama için Mercury'yi kullanıyor. Inception Labs'a göre sıkıştırma iş yüklerinin Mercury'ye taşınması, bu adımın gecikmesini %82 oranında azaltarak yaklaşık 150 saniyeden 27 saniyeye düşürdü ve kaliteyi korurken maliyetini de %90 oranında düşürdü. Kullanım durumu, ekonominin nerede ısırdığını gösteriyor: Kodlama aracıları, her birincil nesil etrafında çok sayıda küçük destekleyici model çağrısı yapıyor ve bu çağrılar arasında gecikme ve maliyet birleşiyor.

Donanımı modeli çalıştıran NVIDIA da bu konuya ağırlık verdi. NVIDIA'nın Hızlandırılmış Bilgi İşlem Grubunda üst düzey ürün yöneticisi olan Shruti Koparkar, Inception'ın NVIDIA AI altyapısında gelişmiş yayılma tabanlı dil modellerine sahip olduğunu ve Mercury 2.5'in sürdürülebilir hızlarla kalite artışının, yeni mimarilerin üretime hazır sistemlere ne kadar hızlı olgunlaşabileceğini gösterdiğini söyledi.

Mercury Voice ve Mercury Router Önizlemeleri

Inception Labs, modelin yanı sıra iki yeni ürünün de önizlemelerini duyurdu. Mercury Voice, en sıkı gecikme bütçelerine sahip ses aracıları için optimize edilmiş bir difüzyon LLM'dir ve ilk jetona ulaşma süresinin 170 milisaniyenin altında olduğunu duyurur. Mercury Router, gelen istemleri anlamak ve bunları en iyi kalite, hız ve maliyet karışımını sunan açık veya kapalı modele yönlendirmek için bir yayılma modeli kullanır ve Inception'ı rakiplerinden ve onlardan biri üzerinde bir katman olarak konumlandırır.

Mercury 2.5, Inception'ın kendi API'sinin yanı sıra Baseten ve OpenRouter aracılığıyla da mevcuttur. Kurumsal dağıtımlar; özel kapasite, otomatik ölçeklendirme, uyumluluk kontrolleri ve yapılandırılabilir veri saklama olanağı sağlar. Şirket, API'yi deneyen geliştiricilere 100 milyon ücretsiz token sunuyor.

Şirket ayrıca, yayılma hızından veya token verimliliğinden hiçbir şekilde ödün vermeyen bir yetenek sıçraması olarak tanımladığı, önümüzdeki aylarda piyasaya sürülmesi hedeflenen, şimdiye kadarki en büyüğü olan bir sonraki modelini eğitmeye başladığını da söyledi. Bu iddia doğrulanırsa, otoregresif yerleşik şirketler üzerindeki baskı ilk olarak fiyat ve gecikmenin çoğu sözleşmeyi belirlediği piyasanın emtia katmanlarında hissedilecek.

Yapay Zekanın Önünde Olun

Yeni model mimariler üretime girerken en son yapay zeka gelişmelerini ve yapay zeka haberlerini takip edin.

Daha fazla AI haberini okuyun →