इनसेप्शन लॅब्सने मंगळवारी मर्क्युरी 2.5 रिलीझ केले, त्याच्या व्यावसायिक प्रसार भाषेच्या मॉडेलची एक नवीन आवृत्ती ज्याचे वर्णन कंपनीने बाजारात सर्वात सक्षम प्रसार LLM म्हणून केले आहे आणि तिच्या माहितीनुसार, आतापर्यंत प्रशिक्षित केलेले सर्वात मोठे प्रसार भाषा मॉडेल आहे. कंपनीच्या घोषणेनुसार, मॉडेल त्याच्या पूर्ववर्ती, मर्क्युरी 2 पेक्षा बुद्धिमत्तेत 40% वाढ देते, त्याच कमी-विलंबता, कमी-किंमतीची सर्व्हिंग प्रोफाइल कायम ठेवते ज्याने उच्च-व्हॉल्यूम वर्कलोडसाठी डिफ्यूजन आर्किटेक्चर आकर्षक बनवले आहे.

सीईओ स्टेफानो एर्मोन यांच्या नेतृत्वाखालील कंपनीने असा दावा केला आहे की मर्करी 2.5 हे GPT-5.6 लुना (लो), जेमिनी 3.5 फ्लॅश-लाइट आणि क्लॉड हायकू 4.5 यासह किंमत-अनुकूलित फ्रंटियर मॉडेलशी तुलना करता येईल. त्या तुलना विक्रेता-अहवाल आहेत आणि अद्याप स्वतंत्र बेंचमार्कद्वारे सत्यापित केल्या गेलेल्या नाहीत, परंतु ते एक प्रसार मॉडेल ठेवतात - दीर्घ संशोधन कुतूहल - ऑटोरेग्रेसिव्ह इनकंबेंट्ससाठी उत्पादन पर्याय म्हणून. नवीनतम AI मॉडेल बातम्यांसाठी, AI Buzz Wire चे चालू असलेल्या मॉडेल कव्हरेजचे अनुसरण करा. एआय मॉडेलच्या ताज्या बातम्या

गती, संदर्भ आणि किंमत

हेडलाइन नंबर आक्रमक आहेत. इनसेप्शन लॅब्सचे म्हणणे आहे की 260,000 टोकन्सच्या कॉन्टेक्स्ट विंडोसह, मर्क्युरी 2.5 मोठ्या प्रमाणावर उपलब्ध NVIDIA GPU वर प्रति सेकंद 1,107 टोकन व्युत्पन्न करते. किंमत $0.20 प्रति दशलक्ष इनपुट टोकन आणि $0.75 प्रति दशलक्ष आउटपुट टोकन्स सेट केली आहे, लॉन्च प्रमोशनसह मॉडेल 80% ते $0.04 प्रति दशलक्ष इनपुट आणि $0.15 प्रति दशलक्ष आउटपुट सवलत आहे.

क्षमतेच्या बाजूने, मॉडेल ट्यून करण्यायोग्य तर्कासह पाठवते — डेव्हलपरला प्रति-विनंतीच्या आधारावर सखोलतेसाठी लेटन्सी व्यापार करू देते — सोबत समांतर टूल कॉल आणि स्ट्रक्चर्ड जनरेशनसाठी स्कीमा-संरेखित JSON आउटपुट. उत्पादन टेलीमेट्रीद्वारे चालविलेल्या प्रशिक्षण लूपचा पहिला परिणाम म्हणून कंपनी रिलीज फ्रेम करते: Mercury 2 लाँच झाल्यापासून, हजारो विकासकांनी ते तयार केले आहे, डझनभर उपक्रमांनी ते तैनात केले आहे, आणि वापर प्रमाणापेक्षा जास्त प्रमाणात वाढला आहे.

डिफ्यूजन मॉडेल्स मजकूर जलद का निर्माण करतात

OpenAI, Google आणि Anthropic मधील मेनस्ट्रीम LLMs ऑटोरिग्रेसिव्ह आहेत: ते एका वेळी एक टोकन मजकूर व्युत्पन्न करतात, प्रत्येक टोकन आधी व्युत्पन्न केलेल्या प्रत्येक गोष्टीवर कंडिशन केलेले असते. त्या अनुक्रमिक अवलंबित्वामुळे पिढीच्या गतीमध्ये कठोर मजला येतो. डिफ्यूजन लँग्वेज मॉडेल्स त्याऐवजी आवाजाच्या ब्लॉकने सुरू होतात आणि समांतरपणे सर्व टोकन्स पुनरावृत्तीने परिष्कृत करतात, जे एकदा मॉडेलला स्वच्छपणे एकत्र येण्यासाठी प्रशिक्षित झाल्यानंतर पारंपारिक GPU हार्डवेअरवर जास्त थ्रूपुट देते.

ट्रेड-ऑफ ऐतिहासिकदृष्ट्या दर्जेदार आहे: डिफ्यूजन मॉडेल्सने तर्क आणि सूचना-खालील बेंचमार्कवर ऑटोरिग्रेसिव्ह मॉडेल्सचा माग काढला आहे. इनसेप्शन लॅब्सची मुख्य बेट — आणि मर्करी 2.5 च्या अंतर्निहित दावा — हा आहे की हे अंतर अशा बिंदूपर्यंत कमी झाले आहे जिथे बहुतेक ग्राहकांना प्रत्यक्षात वाटेल की अक्षावर प्रसार जिंकला जातो: उत्पादनाच्या प्रमाणात विलंब आणि किंमत.

सुरुवातीच्या ग्राहकांकडून उत्पादनाचे दावे

घोषणा बेंचमार्क सारण्यांऐवजी ग्राहकांच्या उपयोजनांवर मोठ्या प्रमाणात झुकते. OpenCall, जे थेट ग्राहक कॉल्ससाठी AI फोन एजंट तयार करते, ने अहवाल दिला की बुधला जाण्याने त्याचे मध्य मॉडेल प्रतिसाद विलंब अंदाजे 170 मिलीसेकंदांवर आला. ओपनकॉलचे सह-संस्थापक आणि CEO, ऑलिव्हर सिल्व्हरस्टीन म्हणाले की, कंपनीचा P99 प्रतिसाद वेळ काही मिनिटांवरून एका सेकंदापर्यंत घसरला आहे आणि त्याचा मध्य 0.4 सेकंदांवरून 0.2 च्या खाली आला आहे — कंपनीने चाचणी केलेल्या इतर कोणत्याही प्रदात्यापेक्षा लक्षणीयरीत्या वेगवान असे आकडे त्यांनी वर्णन केले आहेत, ज्यामध्ये तर्क सक्षम आहे.

Augment Code, एक AI कोडिंग सहाय्यक निर्माता, मर्क्युरीचा वापर संदर्भ कॉम्पॅक्शन, मॉडेल राउटिंग आणि MCP टूल शोधासाठी करते. इनसेप्शन लॅब्सच्या मते, मर्क्युरीवर कॉम्पॅक्शन वर्कलोड हलवल्याने त्या पायरीची लेटन्सी 82% कमी झाली, अंदाजे 150 सेकंदांवरून 27 सेकंदांपर्यंत, आणि गुणवत्ता राखून त्याची किंमत 90% कमी केली. वापर प्रकरण हे स्पष्ट करते की अर्थशास्त्र कोठे दंश करते: कोडिंग एजंट प्रत्येक प्राथमिक पिढीभोवती अनेक लहान सपोर्टिंग मॉडेल कॉल करतात आणि त्या कॉल्समध्ये लेटन्सी आणि कॉस्ट कंपाऊंड करतात.

NVIDIA, ज्यांचे हार्डवेअर हे मॉडेल चालवते, त्याचेही वजन होते. NVIDIA च्या Accelerated Computing Group मधील उत्पादनाच्या वरिष्ठ व्यवस्थापक श्रुती कोपरकर यांनी सांगितले की, Inception मध्ये NVIDIA AI इन्फ्रास्ट्रक्चरवर प्रगत डिफ्यूजन-आधारित भाषा मॉडेल्स आहेत, आणि मर्क्युरी 2.5 चा दर्जेदार स्टेप-अप सातत्यपूर्ण उत्पादन गतीने किती वेगाने वाढू शकतो हे दर्शविते. प्रणाली

बुध आवाज आणि बुध राउटर पूर्वावलोकन

मॉडेलसोबतच, इनसेप्शन लॅब्सने दोन नवीन उत्पादनांचे पूर्वावलोकन जाहीर केले. मर्क्युरी व्हॉईस हे प्रसरण LLM आहे जे व्हॉईस एजंट्ससाठी सर्वात कडक लेटन्सी बजेटसह, 170 मिलीसेकंद अंतर्गत जाहिरात टाइम-टू-फर्स्ट-टोकनसाठी ऑप्टिमाइझ केलेले आहे. मर्क्युरी राउटर इनकमिंग प्रॉम्प्ट्स समजून घेण्यासाठी डिफ्यूजन मॉडेलचा वापर करते आणि त्यांना कोणत्याही मॉडेलवर रूट करते — ओपन किंवा क्लोज — गुणवत्ता, वेग आणि किंमत, पोझिशनिंग इनसेप्शन त्याच्या स्पर्धकांच्या वरचा एक स्तर म्हणून तसेच त्यापैकी एकाचे उत्कृष्ट मिश्रण ऑफर करते.

मर्क्युरी 2.5 इनसेप्शनच्या स्वतःच्या API द्वारे तसेच बेसेटन आणि ओपनराउटरद्वारे उपलब्ध आहे. एंटरप्राइझ डिप्लॉयमेंट समर्पित क्षमता, ऑटोस्केलिंग, अनुपालन नियंत्रणे आणि कॉन्फिगर करण्यायोग्य डेटा धारणा जोडतात. कंपनी API चा प्रयत्न करणाऱ्या विकसकांना 100 दशलक्ष मोफत टोकन देत आहे.

कंपनीने असेही म्हटले आहे की तिने आधीच त्याच्या पुढील मॉडेलचे प्रशिक्षण सुरू केले आहे - त्याचे सर्वात मोठे अद्याप, येत्या काही महिन्यांत रिलीझसाठी लक्ष्यित आहे - ज्याचे वर्णन क्षमतेमध्ये एक झेप म्हणून केले आहे जे प्रसाराची गती किंवा टोकन कार्यक्षमता सोडत नाही. हा दावा कायम राहिल्यास, ऑटोरिग्रेसिव्ह इनकमबंट्सवरील दबाव बाजाराच्या कमोडिटी स्तरांवर प्रथम जाणवेल, जेथे किंमत आणि विलंब बहुतेक करार ठरवतात.

एआयच्या पुढे राहा

नवीनतम AI घडामोडींचे अनुसरण करा आणि आर्टिफिशियल इंटेलिजेंसच्या बातम्यांचे अनुसरण करा कारण नवीन मॉडेल आर्किटेक्चर्स उत्पादनात उतरतात.

अधिक एआय बातम्या वाचा →